L’IA créative te passionne ?
Image, vidéo, son, design génératif : le meilleur chaque soir en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Helios : un modèle vidéo IA à la pointe de la technologie
Bytedance a récemment dévoilé Helios, un modèle de génération vidéo IA qui se distingue par sa capacité à produire des vidéos d'une minute à un rythme impressionnant de 19,5 images par seconde (FPS) sur un seul GPU. Ce modèle, qui repose sur une architecture de 14 milliards de paramètres, est non seulement performant, mais ses codes et poids sont également disponibles publiquement, ouvrant la voie à une large adoption et à des innovations futures.
Les modèles actuels de génération vidéo peinent souvent à dépasser des clips de 5 à 10 secondes, nécessitant plusieurs minutes pour leur rendu. Les solutions en temps réel pour des vidéos plus longues s'appuient généralement sur des modèles plus petits, d'environ 1,3 milliard de paramètres, mais ces derniers ont du mal à maintenir une qualité acceptable. Par exemple, des modèles plus avancés comme Krea-RealTime-14B plafonnent à 6,7 FPS sur un GPU H100 et souffrent de problèmes d'artefacts de dérive.
Une architecture optimisée pour la performance
Helios est basé sur le modèle Wan-2.1-14B, qui nécessite environ 50 minutes pour générer cinq secondes de vidéo sur un GPU A100. Le processus d'entraînement de Helios se déroule en trois phases distinctes : Helios-Base, qui se concentre sur l'architecture et la réduction des dérives ; Helios-Mid, qui introduit la compression des tokens et atteint 1,05 FPS ; et enfin Helios-Distilled, qui maximise la vitesse en simplifiant le calcul à seulement trois étapes.
Lors des tests effectués par les développeurs, Helios-Distilled a atteint une vitesse de 19,53 FPS, surpassant même certains modèles distillés beaucoup plus petits. Par comparaison, SANA Video Long, qui compte 2 milliards de paramètres et est environ sept fois plus petit, n'atteint que 13,24 FPS.
À 19,53 FPS sur un GPU H100, Helios-Distilled rivalise avec la vitesse de modèles bien plus petits de 1,3 milliard de paramètres, tandis que d'autres modèles de 14 milliards de paramètres peinent à dépasser 1 FPS.
Qualité vidéo et évaluation utilisateur
En matière de qualité vidéo, Helios obtient un score de 6,00 pour les vidéos courtes comportant 81 images. Les auteurs du modèle affirment qu'il surpasse tous les modèles distillés et se compare favorablement à la plupart des modèles de base de cette taille. Pour les vidéos longues, Helios a obtenu un score de 6,94, dépassant le précédent leader, Reward Forcing, qui avait un score de 6,88. Une étude utilisateur impliquant 200 participants a confirmé ces résultats.
Helios-Base se classe en tête pour la qualité des vidéos longues et se défend bien face à des modèles de base significativement plus grands pour la génération de vidéos courtes.
Résolution des problèmes de dérive
Les vidéos générées plus longues sont souvent sujettes à des pertes de qualité, de cohérence des couleurs et de contenu au fil du temps. Les modèles précédents tentaient de résoudre ce problème avec des techniques complexes comme le self-forcing, où le modèle réintroduit sa propre sortie comme entrée pendant l'entraînement pour réduire l'écart entre l'entraînement et l'inférence. Helios, quant à lui, adopte une approche différente.
Les auteurs ont identifié trois modèles de dérive typiques et ont proposé des solutions plus simples :
- Codage de position relatif : cette technique empêche le modèle d'atteindre des indices de position inconnus dans les longues vidéos, évitant ainsi des mouvements répétitifs.
- Ancre de première image : elle conserve la première image en mémoire en permanence, offrant au modèle un point de référence visuel pour éviter les dérives de couleur.
- Simulation de perturbation ciblée : cette méthode rend le modèle plus résilient à ses propres erreurs, qui, autrement, s'accumuleraient avec le temps.
Une architecture unifiée pour des tâches multiples
Helios utilise une architecture unifiée qui permet de gérer le texte vers vidéo, l'image vers vidéo et la vidéo vers vidéo dans un seul cadre. Le modèle passe automatiquement d'une tâche à l'autre en fonction du contexte précédent.
- Si le contexte est vide, le modèle génère à partir de texte.
- Si seule la dernière image est présente, il fonctionne comme un animateur d'images.
- Si plusieurs images sont disponibles, il continue une vidéo existante.
Les utilisateurs ont également la possibilité de changer le texte de l'invite en cours de génération ; un fondu progressif entre l'ancienne et la nouvelle invite aide à éviter des ruptures visuelles brusques.
L'architecture de Helios compresse le contexte historique sur trois échelles temporelles et passe automatiquement entre les entrées texte, image et vidéo.
Le modèle a été entraîné en trois étapes sur 800 000 clips vidéo courts, chacun de moins de dix secondes. La résolution atteint actuellement 384 x 640 pixels, et des artefacts de scintillement apparaissent encore lors des transitions de segments. Comme aucun benchmark ouvert n'existe pour les vidéos longues en temps réel, les chercheurs ont construit leur propre jeu de données de test appelé HeliosBench avec 240 invites.
Compression agressive pour réduire les coûts
Helios atteint ses objectifs de vitesse sans recourir aux astuces d'accélération courantes comme le KV cache, l'attention éparse ou la quantification. À la place, le modèle compresse agressivement les données d'entrée à deux niveaux.
-
Une structure de mémoire hiérarchique divise l'historique vidéo en trois échelles temporelles. Les images récentes bénéficient d'une compression plus légère, tandis que les images plus anciennes sont compressées plus fortement. Cela réduit le nombre de tokens à traiter par un facteur de huit.
-
Un processus d'échantillonnage en plusieurs étapes réduit le nombre de tokens pour le segment vidéo en cours de génération par un facteur de 2,29. Les premières étapes fonctionnent à une résolution plus basse, et seules les étapes ultérieures remplissent les détails fins. Ensemble, ces deux techniques réduisent les coûts de calcul à peu près au même niveau que la génération d'une seule image.
À mesure que la longueur du contexte augmente, l'approche naïve voit une augmentation linéaire du nombre de tokens, de l'utilisation de la mémoire et du temps d'inférence, tandis que Helios reste presque constant. L'approche standard manque de mémoire à une longueur de contexte de 6.



