Brief IA : NVIDIA Nemotron 3 Nano Omni : Révolution multimodale pour l'IA

NVIDIA Nemotron 3 Nano Omni : Révolution multimodale pour l'IA

Brief IA
Tom Levy·8 min·6 vues

NVIDIA a lancé le Nemotron 3 Nano Omni, une plateforme d'intelligence artificielle multimodale capable d'analyser des documents, de l'audio et de la vidéo. Cette innovation positionne NVIDIA comme un leader dans le domaine de l'IA, en offrant une compréhension approfondie et une précision de premier ordre sur des classements complexes tels que MMlongbench-Doc et VoiceBench.

En bref
1NVIDIA lance Nemotron 3 Nano Omni, un modèle omni-modal intégrant texte, image, vidéo et audio pour une compréhension avancée.
2Le modèle surpasse les benchmarks comme MMlongbench-Doc et OCRBenchV2, prouvant sa supériorité en intelligence documentaire.
3Avec une architecture hybride innovante, il offre une efficacité jusqu'à 9x supérieure pour les cas d'utilisation multimodaux.
💡Pourquoi c'est importantNemotron 3 Nano Omni redéfinit les capacités de l'IA multimodale, impactant divers secteurs comme l'analyse documentaire et la reconnaissance vocale.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Présentation de NVIDIA Nemotron 3 Nano Omni

NVIDIA a récemment dévoilé le Nemotron 3 Nano Omni, un modèle de compréhension omni-modal qui promet de transformer l'analyse de documents, l'interprétation audio-vidéo et le raisonnement général. Ce modèle élargit la gamme multimodale Nemotron, intégrant des capacités avancées en texte, image, vidéo et audio. Il est conçu pour analyser des documents réels, raisonner sur plusieurs images, reconnaître automatiquement la parole, comprendre l'audio-vidéo à long terme, utiliser des ordinateurs agents et effectuer un raisonnement général.

Le Nemotron 3 Nano Omni se distingue par sa précision exceptionnelle sur des classements complexes tels que MMlongbench-Doc et OCRBenchV2. Il excelle également dans les benchmarks vidéo et audio comme WorldSense et DailyOmni, et atteint une performance maximale sur VoiceBench pour la compréhension audio. Sa rentabilité en compréhension vidéo est démontrée sur MediaPerf.

Une architecture innovante et performante

Le modèle repose sur l'architecture hybride Mamba-Transformer Mixture-of-Experts, combinant un encodeur vision C-RADIOv4-H et un encodeur audio Parakeet-TDT-0.6B-v2. Cette architecture est conçue pour préserver les détails visuels, ajouter une compréhension audio native, et s'adapter à des contextes multimodaux très longs. Elle permet de traiter des images denses, des documents, des vidéos, et de réaliser un raisonnement à modalités mixtes.

La recette d'entraînement utilise un alignement multimodal par étapes et une extension de contexte, suivis d'une optimisation des préférences et d'un apprentissage par renforcement multimodal. Nemotron 3 Nano Omni offre jusqu'à 9x un débit plus élevé et 2,9x la vitesse de raisonnement en flux unique par rapport aux alternatives, grâce à cette méthode sophistiquée.

Les points de contrôle BF16, FP8 et NVFP4 peuvent être téléchargés sur HuggingFace, et pour plus d'informations sur l'architecture du modèle, la recette d'entraînement, les pipelines de données et les benchmarks, le rapport complet sur Nemotron 3 Nano Omni est disponible.

Points forts des benchmarks

En s'appuyant sur Nemotron Nano V2 VL, Nemotron 3 Nano Omni offre des gains visuels substantiels et ajoute de nouvelles capacités audio et vidéo + audio, tout en surpassant un autre modèle omni à poids ouverts, Qwen3-Omni, dans de nombreux domaines. Les domaines concernés incluent la compréhension de documents, le raisonnement CharXiv, la compréhension vidéo, la compréhension vidéo + audio, l'interaction vocale, et le HF Open ASR où moins c'est mieux.

Points forts en matière d'efficacité

Comparé à d'autres modèles omni ouverts avec la même interactivité, Nemotron 3 Nano Omni offre 7,4x plus d'efficacité système pour des cas d'utilisation multi-documents et 9,2x plus d'efficacité système pour des cas d'utilisation vidéo.

Objectifs de Nemotron 3 Nano Omni

À un niveau élevé, Nemotron 3 Nano Omni est destiné à cinq classes de charges de travail :

  1. Analyse de documents réels : Ce n'est pas seulement une question de OCR. Le modèle est conçu pour des documents longs, désordonnés et de grande valeur où la compréhension dépend de la mise en page, des tableaux, des figures, des formules, de la structure des sections, et des références entre pages. Pensez aux contrats, papiers techniques, rapports, manuels, formulaires multi-pages, ou paquets de conformité. Le modèle peut traiter des documents de plus de 100 pages.

  2. Reconnaissance automatique de la parole : Nemotron 3 Nano Omni inclut de fortes capacités de compréhension de la parole qui permettent une transcription de haute qualité dans diverses conditions audio. Il gère l'audio long avec des intervenants variés, des accents, et du bruit de fond. Ces capacités peuvent être intégrées dans des flux de travail plus larges, permettant de transcrire, analyser et combiner le contenu parlé avec d'autres modalités pour des tâches comme la synthèse, la réponse à des questions, et le raisonnement intermodal.

  3. Compréhension audio-vidéo longue : De nombreux flux de travail d'entreprise et de développeurs dépendent d'éléments audio et visuels mixtes : enregistrements d'écran avec narration, vidéos de formation, réunions avec diapositives, tutoriels, démonstrations de produits, captures de support client, et archives vidéo longues. Nemotron 3 Nano Omni est conçu pour raisonner sur ces entrées de manière conjointe.

  4. Utilisation d'ordinateurs agents : Le modèle Nemotron 3 Nano Omni est spécifiquement entraîné pour l'utilisation d'ordinateurs agents, lui permettant d'assister dans des tâches dans des environnements d'interface utilisateur graphique (GUI). Ses capacités incluent l'interprétation de captures d'écran, la surveillance de l'état de l'interface utilisateur, l'ancrage de son raisonnement dans des visuels à l'écran, et l'aide à la sélection d'actions ou à l'automatisation des flux de travail.

  1. Raisonnement multimodal général : Le modèle est conçu pour plus que la perception. Il excelle dans les tâches intensives en raisonnement qui nécessitent de synthétiser des informations à travers de longues fenêtres de contexte, plusieurs modalités, et des preuves structurées ou semi-structurées. Il peut effectuer un raisonnement en plusieurs étapes, réaliser des calculs, et relier des signaux provenant de texte, d'images, de tableaux, et d'autres entrées pour arriver à des réponses cohérentes et bien étayées.

Architecture du modèle et innovations clés

Nemotron 3 Nano Omni utilise un design unifié encodeur-projeteur-décodeur. L'architecture de langage est Nemotron 3 Nano 30B-A3B, associée à l'encodeur vision C-RADIOv4-H et à l'encodeur audio Parakeet-TDT-0.6B-v2. Les encodeurs spécifiques à chaque modalité se connectent à l'architecture LLM via des projeteurs légers.

Une architecture hybride Mamba-Transformer-MoE pour un long contexte multimodal

L'architecture du modèle entrelace trois composants clés :

  • 23 couches Mamba de traitement d'état sélectif pour un traitement efficace des longs contextes
  • 23 couches MoE avec 128 experts, routage top-6, et un expert partagé pour une capacité conditionnelle
  • 6 couches d'attention à requête groupée pour préserver une forte interaction globale et expressivité

Nemotron 3 Nano Omni combine des modèles d'état spatial, de l'attention, et MoE dans un design unifié qui maintient une forte performance de raisonnement tout en restant pratique pour des contextes multimodaux longs.

Résolution dynamique pour des documents denses, des graphiques et des écrans

Du côté vision, Nemotron 3 Nano Omni remplace la stratégie de tiling utilisée dans le modèle v2 par un traitement à résolution dynamique au ratio d'aspect natif. Chaque image peut être représentée par un nombre variable de patches 16 x 16, avec un minimum de 1 024 à un maximum de 13 312 patches visuels par image. Pour les images carrées, cela équivaut à 512 x 512 et 1840 x 1840, respectivement.

Cette flexibilité est cruciale pour gérer des entrées visuelles complexes et haute résolution telles que des documents riches en OCR, des tableaux financiers, des diapositives, des figures de recherche, des captures d'écran, et des mises en page GUI—surtout lorsque des détails fins et la structure globale doivent être compris ensemble.

Compression temporelle Conv3D pour la vidéo

Pour la vidéo, Nemotron 3 Nano Omni utilise un chemin d'embedding Conv3D tubelet dédié. Au lieu d'embeder chaque image indépendamment, chaque paire d'images consécutives est fusionnée en un seul "tubelet" avant le ViT, réduisant de moitié le nombre de tokens visuels que le modèle de langage doit traiter. Cela permet soit de doubler le nombre d'images avec le même budget de tokens, soit de réduire de moitié le nombre de tokens avec le même nombre d'images.

EVS — Échantillonnage vidéo efficace

EVS est une fonctionnalité importante, activée pendant le temps d'inférence, qui élimine les tokens vidéo redondants après l'encodeur vision. Cela réduit la latence et améliore le débit tout en maintenant la précision. La première image de la vidéo est conservée dans son intégralité, puis pour chaque image suivante, EVS conserve les tokens "dynamiques" là où la vidéo change et élimine les tokens "statique" là où rien n'a changé par rapport à l'image précédente. Nous combinons cela avec Conv3D pour permettre une compression supérieure : Conv3D fusionne les tokens de paires d'images en un seul, puis EVS élimine les informations statiques redondantes.

Entrée audio native, pas seulement des transcriptions textuelles

Le côté audio est alimenté par Parakeet-TDT-0.6B-v2, connecté à l'architecture via son propre projeteur MLP à 2 couches. L'audio est échantillonné à 16 kHz, et le modèle est entraîné avec des entrées allant jusqu'à 1 200 secondes (20 minutes), tandis que la longueur maximale de contexte du LLM prend en charge plus de 5 heures.

Cela représente un changement par rapport aux pipelines VLM traditionnels en permettant un traitement audio natif au sein d'une séquence multimodale partagée, permettant aux tokens audio, visuels, et textuels d'être modélisés conjointement. Cela est crucial pour des scénarios comme des enregistrements d'écran narrés, des questions-réponses vidéo où la parole modifie le sens visuel, du contenu long de formation ou de réunion, et des tâches nécessitant un raisonnement multimodal ancré dans le temps.

Projeteurs de modalité légers et entrelacement de tokens unifiés

Chaque encodeur est connecté au LLM avec un projeteur MLP léger à 2 couches qui mappe les caractéristiques de l'encodeur dans l'espace d'embedding partagé. Une fois projetés, les tokens visuels, audio, et textuels sont entrelacés et traités conjointement.

Ce design maintient le système global modulaire tout en permettant un véritable raisonnement intermodal à l'intérieur de l'architecture elle-même.

Données d'entraînement, infrastructure et histoire des systèmes

Les étapes de SFT sont entraînées sur NVIDIA H100, évoluant de 32 à 128 nœuds selon l'étape. La pile utilise Megatron-LM, Transformer Engine, et Megatron Energon, avec parallélisme tensoriel, parallélisme d'experts, parallélisme de séquence, parallélisme de contexte pour les étapes de long contexte, empaquetage de séquence en ligne, et recomputation d'activation sélective.

L'apprentissage par renforcement post-SFT utilise NeMo-RL et NeMo Gym avec un backend Megatron. L'infrastructure RL utilise une configuration distribuée basée sur Ray à travers des clusters B200 et H100, plus une dé-duplication multimodale, de sorte que les rollouts répétés ne multiplient pas la mémoire d'image, de vidéo, et d'audio.

NVIDIA open-source des parties substantielles de son code d'entraînement, facilitant l'accès à cette technologie révolutionnaire.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires