La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
NVIDIA AI-Q, un agent de recherche approfondie, a récemment atteint la première place sur les deux principaux benchmarks pour évaluer les agents de recherche approfondie : DeepResearch Bench et DeepResearch Bench II. Avec des scores de 55,95 et 54,50 respectivement, cette réalisation marque une avancée significative pour la recherche approfondie ouverte et portable. Le fait qu'un seul ensemble configurable domine ces deux benchmarks démontre que des modèles et des outils accessibles aux développeurs peuvent alimenter une recherche agentique à la pointe de la technologie.
Qu'est-ce qui distingue AI-Q ?
AI-Q est un plan ouvert pour la création d'agents d'IA qui raisonnent sur des données d'entreprise et du web pour fournir des réponses bien citées. Il offre une architecture entièrement ouverte et modulaire que les entreprises peuvent posséder, inspecter, personnaliser et configurer selon leur cas d'utilisation. Le chercheur approfondi est un flux de travail au sein du plan plus large d'AI-Q, qui inclut le routage d'intention, la clarification de requête et la recherche superficielle. Le chercheur approfondi adopte une architecture multi-agents composée d'un planificateur, d'un chercheur et d'un orchestrateur, construite sur le NVIDIA NeMo Agent Toolkit et les modèles NVIDIA Nemotron 3 Super ajustés, avec un ensemble optionnel et un affiner de rapport pour une qualité de rapport maximale. Un ensemble - flexible par conception, ajustable à vos besoins.
Pourquoi gagner les deux benchmarks est important
Les DeepResearch Bench I et II évaluent les agents de recherche de manière complémentaire. DeepResearch Bench évalue la qualité des rapports par rapport à un rapport de référence selon des dimensions telles que la complétude, la profondeur d'analyse, le suivi des instructions et la lisibilité. Bien performer ici récompense les récits bien structurés et une forte synthèse. DeepResearch Bench II utilise plus de 70 rubriques binaires détaillées par tâche pour vérifier si un agent récupère les bonnes informations (Rappel d'information), les synthétise en analyses de haut niveau (Analyse) et présente les résultats de manière claire (Présentation). Bien performer ici récompense la précision factuelle granulaire et la rigueur analytique. Être en tête des deux benchmarks signifie que le chercheur approfondi AI-Q produit des rapports bien cités et bien élaborés tout en maîtrisant la récupération et le raisonnement sous-jacents.
Architecture en un coup d'œil
L'architecture du chercheur approfondi AI-Q derrière ces résultats repose sur trois composants : Orchestrateur, Planificateur et Chercheur. L'orchestrateur coordonne la boucle de recherche. Le planificateur cartographie le paysage informationnel et conçoit un plan de recherche fondé sur des preuves. Le chercheur déploie des spécialistes parallèles pour rassembler et synthétiser des preuves à travers plusieurs perspectives analytiques. Chaque agent peut être alimenté par un LLM différent. Un ensemble optionnel exécute plusieurs agents en parallèle et fusionne leurs résultats pour une qualité de rapport maximale et une couverture d'information.
Pile de base : NVIDIA et Deep Research
La même pile sous-jacente alimente les deux soumissions au classement : ouverte, reproductible et construite sur : NVIDIA NeMo Agent Toolkit pour le câblage des flux de travail, l'enregistrement des fonctions et l'évaluation. LangChain DeepAgents pour le flux planificateur-chercheur-orchestrateur en plusieurs phases avec un middleware de sous-agent lorsque cela est applicable. NVIDIA Nemotron 3 LLMs alimentant le pipeline de l'agent. Les modèles Nemotron peuvent être ajustés pour exceller dans la synthèse de recherche et l'appel d'outils à long terme. Le cœur est toujours la recherche multi-étapes (plan → rassembler → synthétiser), la recherche web (Tavily) et la recherche d'articles académiques (Serper), ainsi que des rapports soutenus par des citations. En option, une couche d'ensemble et un affiner de rapport peuvent être ajoutés pour une qualité de rapport maximale.
Ingrédients clés dans AI-Q
Quatre ingrédients ont été centraux pour ces résultats : Architecture multi-agents avec planification fondée sur des preuves et chercheurs spécialisés, construite sur NVIDIA NeMo Agent Toolkit et LangChain DeepAgents. NVIDIA Nemotron 3 Super ajusté : environ 67 000 trajectoires SFT provenant de quelques ensembles de données de départ avec des questions de recherche, filtrées par un juge basé sur des principes. Middleware personnalisé pour la fiabilité à long terme. Le NeMo Agent Toolkit et le middleware LangChain sont étendus avec des composants qui améliorent la fiabilité et la robustesse. Chercheur d'ensemble et affiner de rapport (optionnel) : sorties de pipeline parallèles fusionnées par un LLM, avec un affiner post-hoc pour une qualité de rapport maximale. Chaque élément est détaillé dans les sections suivantes.
NVIDIA Nemotron 3 Super ajusté : Données et formation
Un facteur majeur dans les résultats est un modèle NVIDIA Nemotron-3-Super-120B-A12B ajusté. Nous l'avons choisi pour ce flux de travail car il s'aligne bien avec le raisonnement agentique multi-étapes, l'utilisation d'outils et la rédaction de rapports fondés sur des citations ; l'ajustement sur de véritables trajectoires de recherche et de synthèse le rend efficace pour les rôles de planificateur, de chercheur et d'orchestrateur à grande échelle.
Génération de trajectoires
Nous avons collecté des questions de recherche à partir de plusieurs ensembles de données open source : environ 17 000 questions d'OpenScholar, 21 000 de ResearchQA et 2457 questions de Fathom-DeepResearch-SFT. Ensuite, nous avons généré environ 80 000 trajectoires pour l'ensemble du flux de travail en utilisant le modèle open source GPT-OSS-120B. Chaque trajectoire couvre le comportement du planificateur, du chercheur et de l'orchestrateur. Il convient de noter que ces trajectoires incluent de réels résultats de recherche web provenant des API Tavily et Serper, permettant au modèle d'apprendre à naviguer et à effectuer des recherches et synthèses multi-étapes sur des données réelles.
Filtrage basé sur des principes
La plupart des trajectoires n'ont pas été complétées à temps ou ont été arrêtées en raison du dépassement de la limite d'appels d'outils, mais pour celles qui ont produit des résultats attendus, nous avons appliqué un filtrage supplémentaire en utilisant le modèle juge. Les trajectoires complétées ont été notées avec le modèle nvidia/Qwen3-Nemotron-32B-GenRM-Principle, qui prédit la qualité selon des dimensions telles que la complétude, la lisibilité, la précision et la pertinence. Après filtrage, environ 67 000 trajectoires ont été retenues pour l'entraînement.
Modèle : NVIDIA Nemotron-3-Super-120B-A12B
- Configuration : Un epoch, 5615 étapes, environ 25 heures sur 16×8 NVIDIA H100 GPUs.
Chercheur approfondi AI-Q
Le chercheur approfondi AI-Q adopte une architecture multi-agents (Orchestrateur, Planificateur et Chercheur) avec des boucles itératives plan → rassembler → synthétiser, gestion des citations et middleware personnalisé pour la fiabilité à long terme. Une couche d'ensemble et d'affiner de rapport optionnelle peut être activée pour une qualité de rapport maximale. La conception multi-agents sert également de stratégie de contexte long : chaque sous-agent travaille dans sa propre fenêtre de contexte et ne retourne que sa sortie synthétisée, de sorte que l'orchestrateur ne voit jamais les réponses brutes des outils. Cela maintient le contexte de l'orchestrateur concentré et empêche les résultats de recherche longs et bruyants de dégrader son raisonnement.
Orchestrateur
Coordonne l'ensemble de la boucle de recherche. Appelle le Planificateur pour produire un plan de recherche fondé sur des preuves, puis le Chercheur plusieurs fois avec des tâches de recherche ciblées dérivées de ce plan. Après la recherche, l'orchestrateur examine les contraintes de qualité du plan, déploie une recherche ciblée pour combler les lacunes et rédige le rapport long. Une étape d'affinage optionnelle apporte des modifications au rapport en s'appuyant sur les briefs bruts du chercheur dans une nouvelle fenêtre de contexte - un second point de récupération des preuves.
Planificateur
Fonctionne en deux phases. Un sous-agent Scout cartographie d'abord le paysage informationnel à travers des recherches larges. Un sous-agent Architecte conçoit ensuite le plan de recherche, y compris le plan du rapport, les requêtes de recherche ciblées et les contraintes de qualité, tout en effectuant ses propres recherches pour valider les choix structurels. La planification fondée sur des preuves est essentielle pour produire des rapports fiables et de haute qualité. Notre planificateur connaît le paysage informationnel avant de s'engager dans une structure. Il décide où approfondir et élargir en fonction de ce qu'il a réellement trouvé, et non sur des hypothèses.
Chercheur
Déploie plusieurs sous-agents spécialisés en parallèle, chacun avec une perspective distincte : Collecteur de preuves : faits, statistiques, chiffres spécifiques provenant de sources autorisées. Explorateur de mécanismes : explications causales, cadres théoriques. Comparateur : benchmarks, données comparatives, analyses de compromis. Critique : contre-arguments, limitations, cas d'échec. Scanner d'horizon : développements récents, tendances émergentes. Ils partagent les mêmes outils de recherche, mais avec des cadres analytiques différents. Des spécialistes divers recherchant le même sujet mettent souvent en lumière des preuves qu'un généraliste unique manquerait. Le chercheur synthétise les résultats des spécialistes en un bref document unifié et cité. Un LLM vérifie ensuite cette synthèse par rapport aux sorties brutes des spécialistes dans une nouvelle fenêtre de contexte, récupérant toute information pertinente.
Flexibilité pilotée par la configuration
Chaque composant est interchangeable. Les LLM, outils et graphes d'agents peuvent être configurés via YAML. Le planificateur, le chercheur et l'orchestrateur peuvent chacun être alimentés par un LLM différent. Pour la soumission au benchmark, un Nemotron 3 ajusté alimente le chercheur, qui traite 4 fois plus de tokens que le planificateur et l'orchestrateur combinés.
Middleware personnalisé pour la fiabilité à long terme
Chaque agent et sous-agent entrelace des appels LLM et outils à travers de nombreuses étapes (souvent plus de 32). À cette échelle, le système peut échouer de manière que des interactions courtes ne révèlent jamais. Notre agent harness fournit un middleware personnalisé pour gérer et atténuer ces problèmes : Sanitisation des noms d'outils : Les LLM peuvent halluciner des noms d'outils en cours d'exécution. Ce middleware applique un nettoyage basé sur des modèles, une résolution d'alias et un appariement flou pour récupérer l'outil prévu. Retry conscient du raisonnement : Les LLM avec raisonnement produisent parfois des tokens de réflexion sans appel d'outil ou réponse finale, ce qui pourrait interrompre silencieusement la boucle de l'agent. Le middleware détecte cela, préserve le raisonnement dans le contexte et réessaie. Application des budgets : Chaque agent et sous-agent a son propre plafond d'appels d'outils. Lorsque la limite est atteinte, le système...
