Brief IA : Rho-1 de Reka AI unifie texte, image, vidéo et robots

Rho-1 de Reka AI unifie texte, image, vidéo et robots

Brief IA
Tom Levy·2 min·2 vues

Reka AI a présenté Rho-1, un modèle omni de 19 milliards de paramètres capable de traiter texte, images, vidéo et contrôle robotique dans un seul réseau. L'entraînement a mobilisé 320 GPU H100 pendant environ trois mois, illustrant une avancée vers des modèles intégrant plusieurs modalités et actions dans une seule architecture.

⚡
En bref
1Reka AI présente Rho-1, un modèle omni de 19 milliards de paramètres
2Rho-1 traite texte, images, vidéo et contrôle robotique dans un seul réseau
3L’entraînement a mobilisé 320 GPU H100 pendant environ trois mois
4Un modèle de dynamique inverse permet d’exploiter des vidéos en ligne
💡Pourquoi c'est important — Rho-1 illustre une avancée vers des modèles capables d’intégrer plusieurs modalités et actions dans une seule architecture, dans la continuité des recherches sur les « modèles du monde ».
⚡Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

Reka AI dévoile Rho-1, un modèle « omni » qui associe traitement multimodal et contrôle robotique dans un seul réseau de neurones. L’architecture fonctionne sans outils externes, s’appuie sur 320 GPU H100 pour l’entraînement et utilise un modèle de dynamique inverse pour exploiter des vidéos en ligne. Cette annonce suit le lancement de Reka Core et s’inscrit dans la recherche sur les « modèles du monde ». Rho-1 compte 19 milliards de paramètres.

Rho-1 dans la démarche des « modèles du monde »

La sortie de Rho-1 s’inscrit dans une initiative de recherche en intelligence artificielle visant à développer des modèles dits du monde. En avril 2024, Reka AI avait lancé Reka Core, un modèle de langage multimodal. Reka Core a été présenté comme ayant rivalisé avec GPT-4, Claude 3 et Gemini Ultra lors de benchmarks.

Architecture unifiée et exécution sans outils externes

Rho-1 est capable de traiter et de produire du texte, des images, de la vidéo ainsi que des commandes pour robots au sein d’un unique réseau de neurones. Toutes les modalités sont représentées sous forme de tokens dans une même fenêtre de contexte, à la différence des méthodes qui confient chaque tâche à des modèles distincts. Le modèle fonctionne sans appels d’outils ni recours à des modèles externes. Il peut produire de la vidéo continue en temps réel et répondre à de nouvelles instructions sans redémarrage. Les mêmes poids qui prédisent les images de caméra servent aussi à piloter les mouvements des robots.

Données robot rares, dynamique inverse et entraînement H100

Pour compenser l’absence de jeux de données d’entraînement dédiés aux robots, Reka AI a développé un modèle de dynamique inverse permettant d’obtenir des signaux de contrôle à partir de vidéos classiques issues d’Internet. L’apprentissage de Rho-1 a nécessité l’utilisation de 320 GPU H100 sur une période d’environ trois mois. Il s’agit d’un aperçu de recherche publié par Reka AI pour un modèle omni de 19 milliards de paramètres.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires