Tu codes avec l’IA ?
Outils, agents et nouveautés dev IA décryptés, chaque soir en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Le défi du débogage des agents IA
Déboguer les agents d'intelligence artificielle (IA) s'avère être une tâche ardue. En effet, les trajectoires de ces agents sont souvent longues, stochastiques et impliquent plusieurs agents, ce qui complique l'identification de la cause profonde des échecs. Les agents IA modernes sont caractérisés par des actions sur de longues périodes, une nature probabiliste où la même entrée peut produire des sorties différentes, et des interactions multi-agents où les échecs peuvent se propager, masquant ainsi la cause initiale.
Présentation d'AgentRx : une solution innovante
Pour surmonter ces défis, le cadre AgentRx a été introduit. Ce système se concentre sur l'identification de la première étape de défaillance irréversible, appelée "défaillance critique". AgentRx synthétise des contraintes exécutables et protégées à partir de schémas d'outils et de politiques de domaine, puis enregistre les violations avec des preuves étape par étape. Plutôt que de s'appuyer sur un modèle de langage large (LLM) pour deviner l'erreur, AgentRx utilise un pipeline structuré en plusieurs étapes.
Un benchmark et une taxonomie pour les échecs
Pour évaluer l'efficacité d'AgentRx, un benchmark nommé AgentRx Benchmark a été publié. Il comprend 115 trajectoires échouées annotées manuellement, couvrant trois domaines complexes : τ-bench, Flash, et Magentic-One. De plus, une taxonomie de défaillance à neuf catégories a été développée pour aider à classer les types d'erreurs rencontrées, allant de la "Défaillance d'Adhésion au Plan" à l'"Invention de Nouvelles Informations".
Améliorations significatives grâce à AgentRx
Les résultats obtenus avec AgentRx sont impressionnants. Le cadre améliore la localisation des défaillances de 23,6 % et l'attribution des causes profondes de 22,9 % par rapport aux méthodes basées sur des prompts. En fournissant un journal auditable des défaillances, AgentRx permet aux développeurs de mieux comprendre et corriger les erreurs des agents IA, dépassant ainsi le débogage par essai-erreur traditionnel.
Le processus de diagnostic automatisé
AgentRx traite l'exécution des agents comme un suivi système nécessitant validation. Le cadre suit un processus structuré qui inclut plusieurs étapes :
- Normalisation de la trajectoire : Les journaux hétérogènes provenant de différents domaines sont convertis en une représentation intermédiaire commune.
- Synthèse de contraintes : Le cadre génère automatiquement des contraintes exécutables basées sur des schémas d'outils et des politiques de domaine.
- Évaluation protégée : AgentRx évalue les contraintes étape par étape, vérifiant chaque contrainte uniquement lorsque sa condition de garde s'applique, et produit un journal de validation auditable des violations étayées par des preuves.
- Jugement basé sur LLM : Enfin, un juge LLM utilise le journal de validation et une taxonomie de défaillance ancrée pour identifier l'étape de défaillance critique — la première erreur irréversible.
Un nouveau benchmark pour les échecs d'agents
Le benchmark développé pour AgentRx comprend des trajectoires échouées à travers trois domaines complexes : τ-bench, qui concerne les flux de travail API structurés pour des tâches de vente au détail et de service; Flash, qui se concentre sur la gestion d'incidents réels et le dépannage système; et Magentic-One, qui couvre les tâches web et fichiers ouvertes utilisant un système multi-agents généraliste. Une approche de théorie ancrée a été utilisée pour dériver une taxonomie de défaillance à neuf catégories, aidant les développeurs à distinguer entre des types d'erreurs comme la "Défaillance d'Adhésion au Plan" et l'"Invention de Nouvelles Informations".
Analyse de la densité des échecs à travers les domaines
Dans des systèmes multi-agents comme Magentic-One, les trajectoires contiennent souvent plusieurs erreurs, mais AgentRx se concentre sur l'identification de la première violation critique. Dans nos expériences, AgentRx a démontré des améliorations significatives par rapport aux bases de référence de prompt basées sur LLM : une amélioration de 23,6 % de la précision de localisation des défaillances et de 22,9 % de l'attribution des causes profondes.
Rejoindre la communauté : publication en open source
Pour encourager l'adoption et l'amélioration continues, le cadre AgentRx et le benchmark annoté complet sont publiés en open source. Cette initiative vise à renforcer la fiabilité des agents IA, un élément crucial pour leur utilisation dans le monde réel.
Contributions et remerciements
Le projet a bénéficié des contributions d'Avaljot Singh et Suman Nath, dont le travail a été essentiel à son développement.


