Brief IA

Google dote ses agents IA d'une mémoire persistante pour progresser

🛠️ AI Tools·Tom Levy·

Google dote ses agents IA d'une mémoire persistante pour progresser

Google dote ses agents IA d'une mémoire persistante pour progresser
Key Takeaways
1WikiSkill relie agents IA et base de connaissances persistante, enrichie à chaque exécution
2Les chercheurs rapportent des hausses marquées sur plusieurs benchmarks, surtout en mathématiques et tableurs
3Les bénéfices sont plus importants pour les grands modèles, la transférabilité des compétences doit être vérifiée
💡Why it mattersCe cadre propose une alternative à l'apprentissage continu, permettant aux agents IA d'améliorer leurs performances en capitalisant sur l'expérience accumulée, avec des résultats chiffrés à l'appui.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Un cadre de Google Research associe les agents IA à un wiki de connaissances qui s’enrichit à chaque exécution. Des hausses notables ont été observées sur plusieurs benchmarks, surtout en maths et tableurs, et plus encore avec de grands modèles. Les compétences sont réversibles en cas de contre‑performance et parfois transférables entre modèles, avec des réussites variables selon les tâches.

Des gains annoncés, très contrastés selon les tâches

Les chercheurs indiquent que WikiSkill surpasse systématiquement les autres approches d’évolution des compétences et la base sans compétence. En moyenne, Gemini-3.5-Flash passe de 49,5 % à 68,1 %, tandis que Qwen-3.6-27B progresse de 39,4 % à 63,3 %. Sur des benchmarks individuels, Gemini-3.5-Flash grimpe de 33,0 % à 72,6 % sur LiveMath et de 50,5 % à 76,6 % sur SpreadSheet. Les hausses les plus nettes concernent les problèmes mathématiques et la manipulation de tableurs, alors que des tâches à contexte documentaire long comme OfficeQA n’affichent que des progrès bien moindres. L’écart par rapport à la base augmente avec la taille du modèle.

Effet de la taille des modèles et compétences transférables à vérifier

Les modèles de grande taille tendent à tirer un bénéfice supérieur des compétences évoluées. Des modèles de taille plus réduite intégrant WikiSkill peuvent atteindre les mêmes résultats que des modèles plus grands dépourvus de ce cadre. Les aptitudes acquises par un modèle sont fréquemment transférées à un autre, et il arrive qu’elles dépassent celles que le modèle destinataire avait développées par ses propres moyens ; cette capacité de transfert n’étant pas systématique, il convient de la vérifier individuellement. À l’inverse, des modèles compacts comme Qwen-3.5-4B peinent à appliquer de manière fiable des stratégies de recherche multi‑étapes sur de longs contextes et reviennent à leur comportement par défaut. Les évaluations ont porté sur Qwen (4B, 9B, 27B), Gemma‑4‑31B et Gemini‑3.5‑Flash.

Un cycle d’exécution documenté, proposition de compétences et filtrage

Le processus démarre avec un agent d’inférence qui exécute les tâches à partir de ses compétences actuelles et produit des traces complètes. Un Wiki Maintainer inspecte ces traces, isole des motifs d’échec et des stratégies efficaces, puis les enregistre dans un wiki. Un Skill Proposer exploite ensuite ce wiki mis à jour et les données d’exécution pour suggérer des ajustements ciblés de compétences. Chaque proposition est soumise à un mécanisme de filtrage qui la teste sur un ensemble de validation séparé afin d’en confirmer le bénéfice. Si la compétence échoue, elle est rétrogradée mais le contenu du wiki demeure inchangé ; ces essais non concluants sont également consignés pour orienter les itérations futures. L’évaluation a porté sur cinq benchmarks, incluant raisonnement mathématique, recherche web, utilisation de tableurs, question‑réponse documentaire et tâches interactives.

L’architecture distingue expérience, savoir et action sur trois niveaux

L’architecture sépare l’expérience, la connaissance et l’action via trois niveaux. La Raw Layer conserve des journaux d’exécution immuables allant des appels d’outils aux résultats. Au‑dessus, la Wiki Layer condense ces données en éléments structurés, et, selon les chercheurs, son contenu ne se réinitialise jamais et ne cesse de croître. Enfin, la Skill Layer regroupe les instructions procédurales que l’agent met en œuvre pendant ses tâches ; ces compétences peuvent être annulées si une mise à jour dégrade les performances.

Pas d’apprentissage continu, mais des instructions qui s’affinent

WikiSkill associe les agents IA à une base de connaissances persistante et regroupe les acquis en Agent Skills, des modules réutilisables qui guident le comportement sans toucher aux paramètres appris. L’agent n’effectue pas un apprentissage continu ; il produit et réutilise des instructions de meilleure qualité à chaque exécution. Cette approche est jugée efficace, tout en pouvant être moins élégante et plus sujette aux erreurs qu’un véritable apprentissage. Ce parti pris s’inspire d’une réflexion d’Andrej Karpathy autour d’un « LLM Wiki » visant à transformer l’expérience en connaissances cumulatives et persistantes.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.