Runway veut passer la vidéo IA en mode direct contrôlé

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Runway travaille à générer des vidéos en flux continu, pilotées à la voix, aux gestes ou aux commandes. L’entreprise vise un premier cadre en moins de 100 ms sur une plateforme Nvidia, sans annoncer de calendrier. Derrière cette promesse se jouent des enjeux de coûts GPU, d’applications interactives et d’un défi majeur : empêcher que de petites erreurs visuelles ne se transforment en distorsions.
Un premier cadre visé sous 100 ms, mais aucun calendrier annoncé
En mars, Runway a présenté lors de la conférence GTC un aperçu de recherche concernant un modèle temps réel mis au point avec Nvidia. Ce dispositif fonctionne sur la plateforme Vera Rubin et a été pensé pour délivrer le premier cadre en moins de 100 millisecondes. Aucun calendrier de disponibilité n’a été fourni par Runway. Selon l’entreprise, le passage au temps réel déplace la charge de calcul vers l’utilisation : il faut produire chaque cadre suffisamment vite pour suivre la lecture, sur du matériel partagé entre plusieurs sessions.
Robotique, éducation et conduite autonome misent sur l’interactif
Runway présente les applications interactives comme le cas d’usage majeur à long terme de la vidéo générée. L’éducation, les jeux ou la robotique exigent des réponses aussi rapides que l’attention de l’utilisateur. L’évaluation de robots ou de véhicules autonomes requiert aussi des environnements qui réagissent instantanément aux cas limites, et Runway a déjà introduit GWM Robotics pour générer des données d’entraînement synthétiques. Dans le même esprit, Waymo s’appuie sur Waymo World Model, fondé sur Genie 3 et adapté au trafic, pour simuler des événements que sa flotte n’a jamais rencontrés, comme une tornade, un éléphant ou un quartier inondé. Selon Waymo, son système parcourt des milliards de miles en virtuel avant d’affronter ces scénarios sur route.
Des gains de coûts GPU avancés pour élargir les usages
Runway met en avant une baisse potentielle des coûts avec la génération en temps réel. Des modèles plus rapides consommeraient moins de temps GPU, ce qui améliorerait leur rentabilité. D’après l’entreprise, le coût par sortie à qualité donnée conditionne la viabilité d’une application, et une génération instantanée abaisserait ce seuil, rendant possibles des usages jusqu’ici non rentables. Runway voit aussi dans l’itération immédiate un moyen de réduire l’écart entre une idée et son exécution, en concentrant l’utilisateur sur la direction créative plutôt que sur l’attente.
Limiter l’effet boule de neige des erreurs visuelles
À la différence du texte, la vidéo empile ses sorties : de petites erreurs finissent par produire des distorsions si elles ne sont pas corrigées. Runway décrit ce phénomène comme un problème central des approches inspirées des LLM et affirme entraîner ses modèles sur leurs propres sorties pour apprendre à corriger les écarts au lieu de les amplifier. Les modèles temps réel de la société utilisent l’ensemble des cadres antérieurs comme contexte, ce qui accentue la nécessité d’une robustesse constante à chaque image. D’autres suivent des démarches similaires : Decart a soumis MirageLSD à des images comportant des défauts pendant l’entraînement, et Google DeepMind indique que Genie 3 parvient à maintenir des univers interactifs cohérents sur plusieurs minutes à 24 images par seconde en 720p.
Ce que Runway a déjà dévoilé : GWM‑1, Characters et Solaris
Runway avait amorcé ce virage en mars avec Runway Characters. Le système repose sur GWM‑1, présenté comme le premier Modèle Mondial Général de l’entreprise, introduit en décembre 2025, dérivé de Gen‑4.5, capable de générer des vidéos image par image et de prendre en compte des mouvements de caméra, des commandes de robot ou de l’audio. Il y a quelques semaines, la société a aussi montré Solaris, qui produit des interfaces utilisateur image par image avec des réactions aux clics et à la voix. Plus largement, Runway a partagé un aperçu de recherches visant des vidéos diffusées au fur et à mesure qu’elles sont décrites, et non plus obtenues après une attente. Aujourd’hui, les modèles imposent encore des cycles invite‑attente‑rendu, avec redémarrage en cas d’insatisfaction. L’entreprise affirme que ses utilisateurs perdent surtout du temps à générer et réviser, et dit viser un temps au premier cadre minimal avant une diffusion continue.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.