La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Présentation de NVIDIA Nemotron 3 Nano Omni
NVIDIA a récemment dévoilé le Nemotron 3 Nano Omni, un modèle de compréhension omni-modal qui promet de transformer l'analyse de documents, l'interprétation audio-vidéo et le raisonnement général. Ce modèle élargit la gamme multimodale Nemotron, intégrant des capacités avancées en texte, image, vidéo et audio. Il est conçu pour analyser des documents réels, raisonner sur plusieurs images, reconnaître automatiquement la parole, comprendre l'audio-vidéo à long terme, utiliser des ordinateurs agents et effectuer un raisonnement général.
Le Nemotron 3 Nano Omni se distingue par sa précision exceptionnelle sur des classements complexes tels que MMlongbench-Doc et OCRBenchV2. Il excelle également dans les benchmarks vidéo et audio comme WorldSense et DailyOmni, et atteint une performance maximale sur VoiceBench pour la compréhension audio. Sa rentabilité en compréhension vidéo est démontrée sur MediaPerf.
Une architecture innovante et performante
Le modèle repose sur l'architecture hybride Mamba-Transformer Mixture-of-Experts, combinant un encodeur vision C-RADIOv4-H et un encodeur audio Parakeet-TDT-0.6B-v2. Cette architecture est conçue pour préserver les détails visuels, ajouter une compréhension audio native, et s'adapter à des contextes multimodaux très longs. Elle permet de traiter des images denses, des documents, des vidéos, et de réaliser un raisonnement à modalités mixtes.
La recette d'entraînement utilise un alignement multimodal par étapes et une extension de contexte, suivis d'une optimisation des préférences et d'un apprentissage par renforcement multimodal. Nemotron 3 Nano Omni offre jusqu'à 9x un débit plus élevé et 2,9x la vitesse de raisonnement en flux unique par rapport aux alternatives, grâce à cette méthode sophistiquée.
Les points de contrôle BF16, FP8 et NVFP4 peuvent être téléchargés sur HuggingFace, et pour plus d'informations sur l'architecture du modèle, la recette d'entraînement, les pipelines de données et les benchmarks, le rapport complet sur Nemotron 3 Nano Omni est disponible.
Points forts des benchmarks
En s'appuyant sur Nemotron Nano V2 VL, Nemotron 3 Nano Omni offre des gains visuels substantiels et ajoute de nouvelles capacités audio et vidéo + audio, tout en surpassant un autre modèle omni à poids ouverts, Qwen3-Omni, dans de nombreux domaines. Les domaines concernés incluent la compréhension de documents, le raisonnement CharXiv, la compréhension vidéo, la compréhension vidéo + audio, l'interaction vocale, et le HF Open ASR où moins c'est mieux.
Points forts en matière d'efficacité
Comparé à d'autres modèles omni ouverts avec la même interactivité, Nemotron 3 Nano Omni offre 7,4x plus d'efficacité système pour des cas d'utilisation multi-documents et 9,2x plus d'efficacité système pour des cas d'utilisation vidéo.
Objectifs de Nemotron 3 Nano Omni
À un niveau élevé, Nemotron 3 Nano Omni est destiné à cinq classes de charges de travail :
-
Analyse de documents réels : Ce n'est pas seulement une question de OCR. Le modèle est conçu pour des documents longs, désordonnés et de grande valeur où la compréhension dépend de la mise en page, des tableaux, des figures, des formules, de la structure des sections, et des références entre pages. Pensez aux contrats, papiers techniques, rapports, manuels, formulaires multi-pages, ou paquets de conformité. Le modèle peut traiter des documents de plus de 100 pages.
-
Reconnaissance automatique de la parole : Nemotron 3 Nano Omni inclut de fortes capacités de compréhension de la parole qui permettent une transcription de haute qualité dans diverses conditions audio. Il gère l'audio long avec des intervenants variés, des accents, et du bruit de fond. Ces capacités peuvent être intégrées dans des flux de travail plus larges, permettant de transcrire, analyser et combiner le contenu parlé avec d'autres modalités pour des tâches comme la synthèse, la réponse à des questions, et le raisonnement intermodal.
-
Compréhension audio-vidéo longue : De nombreux flux de travail d'entreprise et de développeurs dépendent d'éléments audio et visuels mixtes : enregistrements d'écran avec narration, vidéos de formation, réunions avec diapositives, tutoriels, démonstrations de produits, captures de support client, et archives vidéo longues. Nemotron 3 Nano Omni est conçu pour raisonner sur ces entrées de manière conjointe.
-
Utilisation d'ordinateurs agents : Le modèle Nemotron 3 Nano Omni est spécifiquement entraîné pour l'utilisation d'ordinateurs agents, lui permettant d'assister dans des tâches dans des environnements d'interface utilisateur graphique (GUI). Ses capacités incluent l'interprétation de captures d'écran, la surveillance de l'état de l'interface utilisateur, l'ancrage de son raisonnement dans des visuels à l'écran, et l'aide à la sélection d'actions ou à l'automatisation des flux de travail.
- Raisonnement multimodal général : Le modèle est conçu pour plus que la perception. Il excelle dans les tâches intensives en raisonnement qui nécessitent de synthétiser des informations à travers de longues fenêtres de contexte, plusieurs modalités, et des preuves structurées ou semi-structurées. Il peut effectuer un raisonnement en plusieurs étapes, réaliser des calculs, et relier des signaux provenant de texte, d'images, de tableaux, et d'autres entrées pour arriver à des réponses cohérentes et bien étayées.
Architecture du modèle et innovations clés
Nemotron 3 Nano Omni utilise un design unifié encodeur-projeteur-décodeur. L'architecture de langage est Nemotron 3 Nano 30B-A3B, associée à l'encodeur vision C-RADIOv4-H et à l'encodeur audio Parakeet-TDT-0.6B-v2. Les encodeurs spécifiques à chaque modalité se connectent à l'architecture LLM via des projeteurs légers.
Une architecture hybride Mamba-Transformer-MoE pour un long contexte multimodal
L'architecture du modèle entrelace trois composants clés :
- 23 couches Mamba de traitement d'état sélectif pour un traitement efficace des longs contextes
- 23 couches MoE avec 128 experts, routage top-6, et un expert partagé pour une capacité conditionnelle
- 6 couches d'attention à requête groupée pour préserver une forte interaction globale et expressivité
Nemotron 3 Nano Omni combine des modèles d'état spatial, de l'attention, et MoE dans un design unifié qui maintient une forte performance de raisonnement tout en restant pratique pour des contextes multimodaux longs.
Résolution dynamique pour des documents denses, des graphiques et des écrans
Du côté vision, Nemotron 3 Nano Omni remplace la stratégie de tiling utilisée dans le modèle v2 par un traitement à résolution dynamique au ratio d'aspect natif. Chaque image peut être représentée par un nombre variable de patches 16 x 16, avec un minimum de 1 024 à un maximum de 13 312 patches visuels par image. Pour les images carrées, cela équivaut à 512 x 512 et 1840 x 1840, respectivement.
Cette flexibilité est cruciale pour gérer des entrées visuelles complexes et haute résolution telles que des documents riches en OCR, des tableaux financiers, des diapositives, des figures de recherche, des captures d'écran, et des mises en page GUI—surtout lorsque des détails fins et la structure globale doivent être compris ensemble.
Compression temporelle Conv3D pour la vidéo
Pour la vidéo, Nemotron 3 Nano Omni utilise un chemin d'embedding Conv3D tubelet dédié. Au lieu d'embeder chaque image indépendamment, chaque paire d'images consécutives est fusionnée en un seul "tubelet" avant le ViT, réduisant de moitié le nombre de tokens visuels que le modèle de langage doit traiter. Cela permet soit de doubler le nombre d'images avec le même budget de tokens, soit de réduire de moitié le nombre de tokens avec le même nombre d'images.
EVS — Échantillonnage vidéo efficace
EVS est une fonctionnalité importante, activée pendant le temps d'inférence, qui élimine les tokens vidéo redondants après l'encodeur vision. Cela réduit la latence et améliore le débit tout en maintenant la précision. La première image de la vidéo est conservée dans son intégralité, puis pour chaque image suivante, EVS conserve les tokens "dynamiques" là où la vidéo change et élimine les tokens "statique" là où rien n'a changé par rapport à l'image précédente. Nous combinons cela avec Conv3D pour permettre une compression supérieure : Conv3D fusionne les tokens de paires d'images en un seul, puis EVS élimine les informations statiques redondantes.
Entrée audio native, pas seulement des transcriptions textuelles
Le côté audio est alimenté par Parakeet-TDT-0.6B-v2, connecté à l'architecture via son propre projeteur MLP à 2 couches. L'audio est échantillonné à 16 kHz, et le modèle est entraîné avec des entrées allant jusqu'à 1 200 secondes (20 minutes), tandis que la longueur maximale de contexte du LLM prend en charge plus de 5 heures.
Cela représente un changement par rapport aux pipelines VLM traditionnels en permettant un traitement audio natif au sein d'une séquence multimodale partagée, permettant aux tokens audio, visuels, et textuels d'être modélisés conjointement. Cela est crucial pour des scénarios comme des enregistrements d'écran narrés, des questions-réponses vidéo où la parole modifie le sens visuel, du contenu long de formation ou de réunion, et des tâches nécessitant un raisonnement multimodal ancré dans le temps.
Projeteurs de modalité légers et entrelacement de tokens unifiés
Chaque encodeur est connecté au LLM avec un projeteur MLP léger à 2 couches qui mappe les caractéristiques de l'encodeur dans l'espace d'embedding partagé. Une fois projetés, les tokens visuels, audio, et textuels sont entrelacés et traités conjointement.
Ce design maintient le système global modulaire tout en permettant un véritable raisonnement intermodal à l'intérieur de l'architecture elle-même.
Données d'entraînement, infrastructure et histoire des systèmes
Les étapes de SFT sont entraînées sur NVIDIA H100, évoluant de 32 à 128 nœuds selon l'étape. La pile utilise Megatron-LM, Transformer Engine, et Megatron Energon, avec parallélisme tensoriel, parallélisme d'experts, parallélisme de séquence, parallélisme de contexte pour les étapes de long contexte, empaquetage de séquence en ligne, et recomputation d'activation sélective.
L'apprentissage par renforcement post-SFT utilise NeMo-RL et NeMo Gym avec un backend Megatron. L'infrastructure RL utilise une configuration distribuée basée sur Ray à travers des clusters B200 et H100, plus une dé-duplication multimodale, de sorte que les rollouts répétés ne multiplient pas la mémoire d'image, de vidéo, et d'audio.
NVIDIA open-source des parties substantielles de son code d'entraînement, facilitant l'accès à cette technologie révolutionnaire.


