Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Google Deepmind : générateurs vidéo et vision par ordinateur
Les chercheurs de Google Deepmind ont développé GenCeption, un modèle qui réutilise un générateur vidéo pré-entraîné pour des tâches classiques de vision par ordinateur telles que l'estimation de profondeur et la segmentation.
Le système s'appuie sur un modèle vidéo open-source d'Alibaba et fournit des résultats en un seul passage avant, guidé par des invites textuelles. Il a été entraîné sur un petit ensemble de vidéos synthétiques et nécessite beaucoup moins de données que les approches concurrentes.
Dans des benchmarks, GenCeption égalise les modèles spécialisés établis et transfère ses capacités à des séquences réelles et à des catégories non entraînées comme les animaux. Les auteurs affirment que cela soutient l'idée contestée selon laquelle les générateurs vidéo peuvent servir de base à des modèles universels du monde en vision par ordinateur.
Un modèle innovant pour des performances de pointe
Un nouveau modèle de Google Deepmind, appelé GenCeption, utilise un modèle de génération vidéo pré-entraîné comme base pour des tâches classiques de vision par ordinateur. Il atteint des performances de pointe dans l'estimation de profondeur, la segmentation et l'estimation de pose 3D tout en nécessitant très peu de données d'entraînement.
Les modèles de langage sont devenus des systèmes de traitement polyvalents presque comme un sous-produit de l'apprentissage pour prédire le mot suivant. Cette tâche semble nécessiter que les modèles absorbent la grammaire, les connaissances du monde et les relations contextuelles pendant l'entraînement. C'est l'explication dominante des capacités émergentes des grands modèles de langage.
La vision par ordinateur manque encore d'une méthode d'entraînement équivalente. Des modèles spécialisés dominent le domaine, y compris "Segment Anything" pour la segmentation et "Depth Anything" pour l'estimation de profondeur. Chacun utilise sa propre architecture.
GenCeption génère des cartes de profondeur, des normales de surface, des masques de segmentation et des estimations de pose à partir de la même vidéo basée sur une invite textuelle. Malgré un entraînement principalement sur des données synthétiques, il fonctionne sur des séquences réelles et des classes d'objets qu'il n'a jamais rencontrées pendant l'entraînement.
Une approche novatrice pour la perception
GenCeption s'appuie sur le modèle vidéo open-source Wan2.1 d'Alibaba. Le changement principal est une architecture simplifiée. Les modèles de diffusion génèrent généralement des vidéos à partir de bruit à travers de nombreuses petites étapes. GenCeption produit plutôt une prédiction en un seul passage avant, ce qui le rend suffisamment rapide pour des tâches pratiques de vision par ordinateur.
Les chercheurs utilisent une méthode simple pour faire en sorte qu'un modèle gère de nombreuses tâches. GenCeption représente chaque sortie comme une image standard à trois canaux RGB, que le résultat soit une carte de profondeur, une carte de normale de surface ou un masque de segmentation. Il convertit également le mouvement de la caméra en une représentation d'image.
Une invite textuelle indique au modèle quelle tâche effectuer, un peu comme une instruction donnée à un chatbot. L'équipe ajoute des modules entraînables pour des tâches telles que la prédiction de points clés 3D, qui ne produisent pas d'images.
L'entraînement utilise une fonction de perte unique pour toutes les tâches. Plutôt que de modifier l'architecture pour chaque tâche, les chercheurs traitent les données d'entraînement pour tenir compte des exigences spécifiques à chaque tâche.
Des résultats impressionnants avec peu de données
La plupart des données d'entraînement proviennent d'un ensemble de données synthétiques contenant seulement 7 500 vidéos. L'équipe a combiné 800 modèles humains numériques avec 200 séquences de mouvement d'un ensemble de données de capture de mouvement. Elle a ensuite rendu les résultats dans Blender avec différents arrière-plans et angles de caméra. Des vidéos réelles ont été utilisées uniquement pour la segmentation guidée par le langage.
GenCeption approche des résultats de pointe dans de nombreuses tâches tout en utilisant entre un septième et un cinq-centième des données d'entraînement par rapport aux modèles établis.
Selon l'étude, GenCeption égalise ou dépasse les résultats de pointe dans de nombreux benchmarks malgré l'utilisation d'une architecture unique pour chaque tâche. Ses estimations de profondeur correspondent à celles de modèles spécialisés tels que DepthAnything 3. GenCeption surpasse NormalCrafter et Lotus-2 en estimation de normales de surface. Il surpasse également Genmo et TRAM en reconnaissance de pose 3D. Sur la segmentation complexe guidée par le langage, il égalise SAM 3 de Meta combiné avec Gemini 3.5 Flash.
Des modèles tels que D4RT et VGGT Omega ont été entraînés sur des millions de vidéos. GenCeption atteint des résultats similaires en utilisant 7 à 500 fois moins de données. Lorsqu'il est testé dans les mêmes conditions, le pré-entraînement sur la génération vidéo surpasse également des méthodes telles que V-JEPA et VideoMAE V2. Les auteurs attribuent ces résultats à la tâche de génération plutôt qu'au volume de données seul. Ils soutiennent que la génération vidéo aide les modèles à apprendre des représentations utiles de l'espace et du mouvement.
Généralisation forte mais avec des limites claires
GenCeption a été entraîné presque exclusivement sur des vidéos synthétiques montrant une seule personne à la fois, mais il fonctionne toujours sur des vidéos réelles avec plusieurs personnes dans le cadre, ainsi que sur des catégories non liées telles que les animaux et les robots humanoïdes. Selon l'étude, certaines sorties contiennent plus de détails que les rendus Blender utilisés pour l'entraînement. Les résultats peuvent préserver les moustaches d'un chat et les contours de mèches de cheveux individuelles.
GenCeption a été entraîné uniquement sur des vidéos synthétiques de personnes, mais transfère ses capacités de perception à des catégories animales qu'il n'a jamais rencontrées pendant l'entraînement.
L'entraînement conjoint sur toutes les tâches nuit à l'estimation des points clés 3D. Les chercheurs soupçonnent que les composants supplémentaires nécessaires pour cette tâche interfèrent avec les mécanismes appris par le modèle de base pendant le pré-entraînement.
Leur conclusion est que le moins de changements possible devrait être apporté à l'architecture originale du modèle. La vitesse de traitement doit également être améliorée. Le modèle plus petit prend environ six secondes pour traiter une vidéo de 81 images, tandis que le modèle plus grand, qui compte 14 milliards de paramètres, prend environ dix secondes.
Les générateurs vidéo comme modèles du monde
Les auteurs rejettent l'idée que les générateurs vidéo ne sont que des outils de divertissement. Ils soutiennent que ces modèles contiennent déjà une sorte de "modèle du monde" universel qui pourrait soutenir un modèle fondamental pour la vision par ordinateur. Un tel système pourrait remplir le même rôle dans le traitement d'image que les grands modèles de langage dans le texte.
La validité de ce cadre est débattue. Une équipe de recherche internationale a récemment proposé une définition uniforme avec OpenWorldLib et a explicitement exclu les modèles texte-à-vidéo parce qu'ils manquent de rétroaction du monde réel.
L'ancien scientifique en chef de l'IA chez Meta, Yann LeCun, est allé plus loin, affirmant que les modèles vidéo génératifs sont une impasse. V-JEPA 2 de Meta suit l'alternative qu'il a défendue, prédisant des concepts abstraits plutôt que des pixels. Un benchmark de l'Université de Tsinghua souligne les limites de la prédiction de pixels. Sora 2, Seedance 2.0 et Veo 3.1 ont échoué à plusieurs reprises à des tests de physique et de logique de base, même lorsque leur sortie semblait convaincante.
GenCeption utilise la génération vidéo à des fins plus étroites. Les chercheurs ne demandent pas à Wan2.1 de prédire comment le monde se comportera. Ils l'utilisent pour extraire des caractéristiques pour des tâches spécifiques telles que l'estimation de profondeur et la segmentation, où ces caractéristiques apprises peuvent surpasser les systèmes spécialisés. Google Deepmind explore également une approche différente avec Genie 3, qui construit des environnements 3D interactifs pour former des agents d'IA.



