Brief IA : Orchard : Révolutionner l'IA agentique avec un cadre open-source

Orchard : Révolutionner l'IA agentique avec un cadre open-source

Brief IA
Tom Levy·6 min·3 vues

Orchard propose un cadre open-source pour l'IA agentique, intégrant des environnements réutilisables pour divers domaines. Orchard-SWE atteint 73,0 % avec le reranking du modèle de valeur, rivalisant avec des modèles dix fois plus grands. Orchard-GUI et Orchard-Claw montrent l'efficacité des petits modèles sur des tâches web et de productivité, avec des scores élevés sur plusieurs benchmarks.

En bref
1Orchard propose un cadre open-source pour l'IA agentique, intégrant des environnements réutilisables pour divers domaines.
2Orchard-SWE atteint 73,0 % avec le reranking du modèle de valeur, rivalisant avec des modèles dix fois plus grands.
3Orchard-GUI et Orchard-Claw montrent l'efficacité des petits modèles sur des tâches web et de productivité, avec des scores élevés sur plusieurs benchmarks.
💡Pourquoi c'est importantOrchard démocratise l'accès à l'IA agentique, réduisant les barrières d'entrée pour les chercheurs grâce à une infrastructure ouverte.
Le brief IA que lisent les pros

Tu codes avec l’IA ?

Outils, agents et nouveautés dev IA décryptés, chaque soir en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Orchard : Un cadre open-source pour l'IA agentique évolutive

Orchard se positionne comme un cadre open-source novateur, dédié à la recherche sur l'intelligence artificielle agentique évolutive. Au cœur de ce système se trouve Orchard Env, un service d'environnement réutilisable qui facilite l'entraînement et l'évaluation des agents à travers divers domaines de tâches. Cette infrastructure unique permet aux chercheurs de travailler avec des agents dans des domaines aussi variés que le développement logiciel, la navigation web et les assistants personnels, tout en utilisant des environnements de déploiement réels tels que Codex, OpenClaw et ZeroClaw. Grâce à Orchard, les chercheurs peuvent réutiliser les environnements, les pipelines de données et les workflows d'évaluation, ce qui simplifie considérablement le processus de recherche.

La même infrastructure Orchard est capable de prendre en charge des agents dans des domaines aussi divers que le développement logiciel, la navigation web et l'assistance personnelle. Cela signifie que les chercheurs peuvent entraîner ces agents directement dans des environnements de déploiement réels, ce qui constitue un avantage significatif. Par exemple, Orchard-SWE, Orchard-GUI et Orchard-Claw démontrent que même des modèles à poids ouverts relativement petits peuvent obtenir des résultats impressionnants sur des tâches complexes du monde réel. Orchard-SWE, par exemple, atteint un score de 69,7 % sur le benchmark SWE-bench Verified, et ce, en utilisant seulement environ 3 milliards de paramètres actifs. Cela le rapproche des systèmes de pointe qui utilisent des modèles bien plus volumineux. De plus, avec le reranking du modèle de valeur, Orchard-SWE atteint 73,0 %, ce qui le rend encore plus compétitif.

Partage de données et méthodes d'évaluation

En plus de fournir des modèles et des workflows, Orchard met à disposition des données d'entraînement et des méthodes d'évaluation. Ces ressources sont destinées à aider la communauté de recherche à construire et à étudier des systèmes agentiques ouverts. L'intelligence artificielle évolue rapidement, passant de la simple réponse à des questions à des agents autonomes capables de planifier, de raisonner et d'agir dans des environnements complexes et multistep. Ces systèmes sont capables de corriger des bugs dans des bases de code complexes, de naviguer sur le web pour le compte d'un utilisateur et de gérer des flux de travail impliquant des calendriers et des e-mails.

Défis et solutions pour l'IA agentique

Malgré l'enthousiasme croissant autour des capacités de l'IA agentique, la communauté de recherche est confrontée à un obstacle majeur : la nécessité d'une infrastructure propriétaire. Cette dernière inclut souvent des sables de test personnalisés, des pipelines d'entraînement fermés et des ensembles de données propriétaires, inaccessibles à la plupart des chercheurs et praticiens. Orchard vise à combler cette lacune en offrant un cadre open-source pour la modélisation agentique évolutive. Au cœur d'Orchard se trouve Orchard Env, un environnement léger basé sur Kubernetes, qui fournit des composants isolés réutilisables pour exécuter et construire des agents à grande échelle.

Contrairement à de nombreux cadres existants, Orchard Env est conçu pour prendre en charge différents systèmes d'agents et types de tâches sans nécessiter de modifications. Le même service peut soutenir des agents de développement logiciel, des agents de navigation web et des agents d'assistance personnelle à travers différents domaines. Pour démontrer cette approche, trois recettes d'entraînement spécifiques à des domaines ont été publiées : Orchard-SWE, Orchard-GUI et Orchard-Claw. Les données d'entraînement et les méthodes d'évaluation utilisées pour les construire sont également mises à disposition.

Une couche d'environnement adaptable

L'idée centrale derrière Orchard est que l'environnement d'exécution doit être un service autonome et réutilisable, plutôt qu'une infrastructure intégrée dans un cadre d'entraînement spécifique. Grâce à sa fondation Kubernetes, Orchard peut créer, gérer et supprimer des milliers de composants isolés en parallèle. Le système est conçu pour fonctionner à travers des tâches telles que la programmation, la navigation web et l'utilisation d'outils, ainsi que différents systèmes d'agents et étapes du processus d'entraînement et d'évaluation.

Orchard permet également d'entraîner des agents à l'intérieur de n'importe quel environnement. Les agents les plus performants d'aujourd'hui ne fonctionnent que rarement comme un modèle nu. Ils opèrent à travers des environnements sophistiqués—tels que Claude Code, Codex et OpenClaw—qui gèrent le raisonnement multi-tours, l'utilisation d'outils et les connexions à des systèmes externes. Les outils d'entraînement ouverts ne peuvent généralement pas gérer ces environnements multi-processus et avec état, obligeant les chercheurs à s'entraîner sur un modèle simplifié puis à déployer dans le cadre réel, ce qui crée un décalage. Orchard comble cette lacune : un proxy léger enregistre les appels de modèle de l'environnement lui-même comme données d'entraînement tandis que chaque déploiement s'exécute dans son propre conteneur, permettant à un agent d'être entraîné de bout en bout directement dans l'environnement avec lequel il sera déployé—OpenClaw, Codex, ZeroClaw, ou d'autres—et à travers plusieurs environnements.

Orchard-SWE : Pionnier des agents de développement logiciel

Le développement logiciel représente un environnement particulièrement exigeant pour les agents autonomes. Orchard-SWE est un workflow d'entraînement spécifiquement conçu pour ce domaine. Il utilise le cadre Mini-SWE-Agent pour résoudre de manière autonome des tâches de développement logiciel et est évalué sur le benchmark SWE-bench Verified. Pour entraîner le système, 107 000 interactions d'agents ont été distillées à partir de modèles avancés, couvrant un large éventail de problèmes GitHub.

Le processus d'entraînement d'Orchard-SWE utilise un affinage supervisé par attribution de crédit, permettant au système d'apprendre des tentatives partielles productives. L'apprentissage par renforcement est également utilisé, bien que ses retours soient rares. Des techniques de récompense dense, telles que la distillation on-policy et un modèle de récompense de processus, sont ajoutées pour une guidance plus riche. Enfin, un modèle de valeur est entraîné sur les déploiements passés pour réévaluer les solutions candidates. Orchard-SWE passe d'un baseline de 61,4 % à 69,1 % avec le Balanced Adaptive Rollout et atteint 69,7 % avec les techniques de récompense dense, atteignant finalement 73,0 % avec le reranking du modèle de valeur.

Orchard-GUI : Un agent de navigateur performant

La navigation web présente des défis uniques, nécessitant des agents capables d'interpréter des mises en page visuelles et d'interagir avec des interfaces dynamiques. Orchard-GUI entraîne un modèle de vision-langage de 4 milliards de paramètres en tant qu'agent de navigateur, utilisant une supervision limitée. Malgré cela, le modèle obtient de bons résultats sur plusieurs benchmarks de navigation web : 74,1 % sur WebVoyager, 67,0 % sur Online-Mind2Web, et 64,0 % sur DeepShop, pour une moyenne de 68,4 %. Ces résultats placent Orchard-GUI parmi les agents web open-source les plus performants à ce jour.

Orchard-Claw : Agents pour la productivité quotidienne

Orchard-Claw se concentre sur les tâches d'assistance personnelle, entraînant un agent sur seulement 200 tâches synthétiques. Évalué sur Claw-Eval, il réussit à compléter 59,6 % des tâches lorsqu'on lui donne jusqu'à trois tentatives. Ce chiffre augmente à 73,9 % lorsqu'il est associé au système d'agent plus puissant ZeroClaw. Parce qu'Orchard peut entraîner des agents directement à l'intérieur de véritables environnements de déploiement, Orchard-Claw est entraîné à travers plusieurs d'entre eux, y compris ReACT, ZeroClaw, OpenClaw, et Codex. Sous l'environnement Codex, son taux de réussite passe de 18,6 % pour le modèle non entraîné à 51,5 % après l'entraînement Orchard.

Implications pour la recherche en IA

Les résultats d'Orchard soulignent l'importance de la couche d'environnement dans la recherche en IA agentique. En rendant l'infrastructure sous-jacente ouverte, légère et réutilisable, Orchard réduit le coût de la recherche et élimine le besoin de construire des isolats personnalisés.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires