Scènes 3D depuis une photo : GPT‑6 Astra brille mais s’auto-évalue mal

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Des chercheurs du Maryland et d'AWS montrent qu’un agent peut coder une scène 3D Blender à partir d’une seule image. Testés sur un nouveau banc d’essai, les modèles livrent souvent un résultat exploitable mais peinent à s’évaluer eux‑mêmes et à restituer la géométrie. Un plugin fondé sur des métriques objectives améliore nettement les variantes les plus faibles, tandis que GPT‑6 Astra signe les meilleurs scores, avec des plafonds mesurés.
Un écart persistant et un écosystème déjà en mouvement
Un écart important subsiste entre une scène fonctionnelle et une reconstruction fidèle. Les chercheurs estiment que les programmes de scènes exécutables issus des agents de codage montrent un potentiel mais ne sont pas encore suffisamment précis. La supériorité de GPT‑6 Astra mesurée sur LEGO‑Bench est en accord avec d’autres constats. Selon le chercheur en IA Yoav Artzi, ce modèle représente une avancée significative dans la compréhension spatiale et aurait probablement été formé à partir de volumes importants de données 3D, telles que des scènes Blender. Les sociétés éditrices de logiciels 3D se préparent déjà à l’arrivée de ces agents : Unity propose désormais des plugins officiels pour Claude Code et Codex. D’autres approches reconstruisent les scènes directement à l’intérieur du modèle, comme Atlas de World Labs. Google Deepmind suit une voie différente avec GenCeption, un modèle vidéo pour l’estimation de profondeur et la segmentation qui atteint les performances de modèles spécialisés.
Ce que montrent les scores sur LEGO‑Bench
Lors des essais, les six modèles GPT testés ont presque toujours généré une scène fonctionnelle, mais la précision variait fortement. GPT‑6 Astra a obtenu 53,4 % sur les scènes intérieures et 39,6 % sur les extérieures, tandis que les configurations plus faibles atteignaient environ 15 %. GPT‑6 Astra s’est révélé le plus proche des images de référence. Les modèles plus anciens omettaient souvent des angles de caméra, de l’éclairage ou des objets entiers. La précision diminue avec la complexité des scènes, et les extérieures sont plus difficiles que les intérieures. En augmentant le budget de raisonnement, les variantes de GPT‑6 se sont nettement améliorées : sur un sous-ensemble de tests de bureau, le score d’Astra est passé de 32,3 % à 61,8 %. Les premières tentatives de travail sont souvent médiocres, des révisions peuvent annuler des progrès antérieurs et l’auto-évaluation reste peu fiable.
L’auto‑évaluation échoue ; un plugin impose des métriques et booste les faibles
Lorsqu’il s’agit de choisir entre deux versions d’une scène, les jugements géométriques des modèles sont proches ou en dessous du niveau de hasard. Un agent n’arrive pas à évaluer de manière fiable si sa scène a progressé. Les chercheurs estiment que le perfectionnement doit reposer sur des métriques tangibles plutôt que sur l’appréciation de l’agent. Ils ont ainsi développé LEGO‑Plugin, une extension qui fonctionne sans nécessiter de phase d’entraînement supplémentaire, qui associe la scène initiale à l’image de référence, substitue l’auto-évaluation par des critères objectifs et préserve les avancées correctes contre des modifications qui dégraderaient la scène. Le plugin a amélioré les performances des six modèles testés, avec des gains particulièrement importants pour les plus faibles, jusqu’à 62,7 % d’augmentation, tandis que le modèle déjà performant a gagné environ deux points de pourcentage.
Le banc d’essai LEGO‑Bench et sa méthode de scoring
LEGO‑Bench sert d’outil d’évaluation et regroupe 208 images issues de 104 scènes, avec 443 actifs enregistrés. Les chercheurs soulignent qu’il est difficile d’obtenir une vérité 3D précise à partir de photos réelles et que les scènes synthétiques simples manquent de réalisme. Pour concilier ces exigences, les images sont rendues à partir de simulateurs conçus professionnellement, la géométrie, la profondeur et les attributions d’objets restant cachées pour permettre un scoring automatisé. La complexité des scènes peut être augmentée sans modifier l’éclairage ni les réglages de la caméra. L’évaluation se fait sur trois axes : la Validité, qui vérifie qu’un artefact exploitable a bien été produit ; la Reconstruction, qui mesure la précision géométrique visible ; et l’Apparence, qui compare un re-rendu pixel par pixel à l’image de référence.
LEGO‑Anything génère un script Blender depuis une photo
LEGO‑Anything, mis au point par des chercheurs du Maryland et d’AWS, charge un agent de produire un programme Blender à partir d’une image en suivant la méthode Image‑to‑Code. L’agent avance par étapes successives : il rédige, exécute, inspecte puis ajuste le code, la sortie décrivant de façon explicite les objets, la géométrie, la disposition et la position de la caméra. Ce format exécutable peut être contrôlé et modifié comme un code informatique, mais les chercheurs signalent des faiblesses en matière d’auto-évaluation et de fidélité géométrique. Les scènes reconstruites ont servi de base à des tâches de vision par ordinateur comme la détection d’objets, la segmentation et l’estimation de profondeur, extraites directement du programme. Sans entraînement supplémentaire, les résultats sont utilisables mais restent modestes : la détection d’objets atteint environ la moitié des performances du modèle spécialisé DINO, tandis que l’écart est plus important pour la segmentation et la profondeur face à des références comme SAM 3 et Depth Anything 3.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.