Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Nvidia a récemment lancé le Nemotron 3 Nano Omni, un modèle d'intelligence artificielle qui se distingue par sa capacité à traiter simultanément le texte, les images, la vidéo et l'audio. Ce modèle est conçu pour des applications agentiques, et il est ouvert à un usage commercial.
Le Nemotron 3 Nano Omni a été entraîné avec un impressionnant volume de 717 milliards de tokens. Une part significative de ces données d'entraînement est issue de modèles concurrents tels que Qwen, gpt-oss et DeepSeek-OCR. En plus de fournir les poids du modèle, Nvidia a également rendu publiques certaines données d'entraînement et les pipelines associés.
Ce modèle open-source, qui repose sur une architecture hybride Mamba-Transformer avec Mixture-of-Experts, active environ trois milliards de paramètres par requête. Il utilise l'encodeur de vision C-RADIOv4-H de Nvidia et l'encodeur audio Parakeet-TDT, avec une fenêtre de contexte pouvant atteindre 256 000 tokens. Actuellement, l'anglais est la seule langue officiellement supportée.
Selon le rapport technique, le Nemotron 3 Nano Omni est principalement destiné à des applications telles que le traitement de documents, les agents d'utilisation informatique, l'analyse vidéo et audio, ainsi que l'interaction vocale. Sur des benchmarks comme OCRBenchV2, MMLongBench-Doc, WorldSense et VoiceBench, il surpasse son prédécesseur, le Nemotron Nano V2 VL, et rivalise avec le Qwen3-Omni d'Alibaba. Sur OSWorld, un benchmark pour agents GUI, sa précision a bondi de 11,1 à 47,4 points par rapport à la version précédente. Nvidia affirme que son débit est jusqu'à neuf fois supérieur à celui de Qwen3-Omni.
Influence des modèles concurrents sur l'entraînement
L'entraînement du Nemotron 3 Nano Omni a été réalisé en sept étapes, avec une fenêtre de contexte qui s'élargit progressivement. Les données d'entraînement synthétiques incluent des légendes d'images, des paires question-réponse et des traces de raisonnement générées à partir de modèles comme Qwen3-VL-30B-A3B-Instruct, Qwen3.5-122B-A10B, et gpt-oss-120b d'OpenAI. Nvidia a également utilisé GPT-4o et Gemini 3 Flash Preview pour le filtrage.
L'utilisation de modèles concurrents pour l'entraînement est une pratique courante dans l'industrie, bien que rarement aussi transparente. Des entreprises comme OpenAI, Anthropic et Google ont souvent accusé des laboratoires chinois de distillation à grande échelle.
Les données audio incluent les ensembles de données Granary et SIFT-50M de Nvidia, ainsi que des légendes de l'Omni-Captioner de Qwen. Pour l'apprentissage par renforcement, un pipeline en cinq étapes a été mis en place, couvrant 25 environnements et des tâches variées comme l'ancrage visuel et la reconnaissance automatique de la parole.
En plus des poids en BF16, FP8 et NVFP4, Nvidia publie des parties des données d'entraînement, les pipelines sur Megatron-Bridge, et les recettes de RL sur NeMo-RL. Le mode de raisonnement est activé par défaut, nécessitant une désactivation manuelle pour certaines tâches. Le modèle est distribué sous l'accord NVIDIA Open Model Agreement, permettant un usage commercial.


