Tu veux les meilleurs outils IA avant les autres ?
On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
AgenticSTS : l'IA excelle à Slay the Spire 2
Les agents d'IA remportent des victoires à Slay the Spire 2 après que des chercheurs aient remplacé les journaux de discussion en croissance par une mémoire structurée.
Les modèles de pointe ont échoué à plusieurs reprises dans le jeu de cartes numérique Slay the Spire 2. Une nouvelle architecture de mémoire montre que le problème ne réside pas tant dans le modèle lui-même, mais dans ce qu'il retient des mouvements précédents.
Une nouvelle approche de la mémoire
Quel pourcentage de ses conversations passées un agent d'IA devrait-il même voir lorsqu'il poursuit un objectif à travers des centaines de décisions ? Le projet AgenticSTS, développé au Alaya Lab avec l'Université Jiao Tong de Shanghai et d'autres institutions, renverse la réponse habituelle. L'agent ne voit jamais son propre journal de discussion, mais reconstruit chaque décision à partir d'un catalogue fixe d'informations soigneusement organisées.
AgenticSTS ne conserve pas un journal en constante expansion. Il reconstruit chaque décision à partir de cinq couches de mémoire organisées.
Un test avec Slay the Spire 2
Les chercheurs ont choisi le roguelike de construction de deck Slay the Spire 2 comme terrain d'essai. Une seule partie implique des centaines de décisions, allant du choix des cartes et de la planification des combats à la sélection des itinéraires sur la carte et à l'achat d'objets. Les règles se traduisent entièrement par du texte, le hasard est élevé et les parties sont longues. Selon les développeurs, les joueurs humains gagnent 16 % du temps au niveau de difficulté le plus bas, A0. Les modèles de pointe utilisés dans l'évaluation AGI-Eval n'ont remporté aucune partie sur cinq configurations testées. Le jeu est difficile mais suffisamment ouvert pour que les différences architecturales se manifestent clairement.
Une structure de mémoire efficace
Les agents typiques de LLM comme ReAct ou Reflexion ajoutent des observations passées, des appels d'outils et des auto-réflexions au prochain prompt. Le contexte grandit à chaque étape jusqu'à ce que la fenêtre déborde ou que l'attention du modèle se dilue. AgenticSTS fait le contraire. Pour chaque décision, le prompt est construit à partir de cinq emplacements clairement séparés.
Les cinq emplacements en détail :
- L1 : instructions de protocole fixes
- L2 : schémas d'état avec actions actuellement valides
- L3 : règles de jeu récupérées
- L4 : résumés des parties précédentes
- L5 : compétences stratégiques déclenchées pour des situations spécifiques
Tout ce que l'agent souhaite conserver d'une décision précédente doit d'abord être écrit dans l'une de ces zones de stockage. Cela maintient le prompt court, peu importe la durée d'une partie, et comme chaque couche est abordée séparément, les chercheurs peuvent identifier quel composant améliore réellement les performances.
Une bibliothèque de compétences qui double le taux de victoire
Pour la comparaison principale, l'équipe a exécuté cinq configurations les unes contre les autres, avec dix parties chacune au niveau de difficulté le plus bas, A0. Sans aucune couche de mémoire, l'agent gagne 3 parties sur 10. Une fois que la bibliothèque de compétences L5 est activée, stockant des règles tactiques pour des situations récurrentes, le taux de victoire grimpe à 6 sur 10. Cela reste vrai que les compétences aient été écrites à la main ou générées à partir de modèles.
Lorsque l'agent continue d'apprendre entre les parties, il atteint les niveaux d'Ascension A6 à A8. Sans cette mémoire, il plafonne à A2 à A4.
Les coûts de tokens révèlent l'écart réel
Plus intéressant que les ajustements apportés à la propre base de code de l'équipe est la comparaison avec deux agents Slay the Spire 2 disponibles publiquement qui suivent le modèle classique de transcript en croissance, STS2MCP et CharTyr. Tous les agents ont utilisé Gemini 3.1 Pro pour les décisions stratégiques. Aucun des concurrents n'a remporté l'une de ses 5 parties.
Les chiffres des coûts sont encore plus frappants : pour chaque point marqué par les deux concurrents, ils envoient 66 à 90 fois plus de tokens au modèle de langage qu'AgenticSTS. La raison est le journal en croissance. Dans STS2MCP, un seul appel de modèle près de la fin d'une partie a atteint environ 527 000 tokens, car l'historique complet du jeu est renvoyé avec chaque nouvelle décision. AgenticSTS maintient le texte utilisateur réel à environ 5 000 tokens, peu importe la durée du jeu.
Ce qui reste à faire
L'équipe n'a pas encore réalisé le véritable test : exécuter un contexte accumulant au sein de la même base de code en utilisant le même scoring. Les métriques clés sont basées sur 50 parties, et jusqu'à présent, seul un personnage (Silent) a été testé sur une version de jeu unique. Il reste à voir si l'approche fonctionne pour d'autres personnages et mises à jour.
L'équipe publie 298 parties complètes, des instantanés de mémoire gelés et des scripts d'évaluation sur Hugging Face, afin que d'autres groupes de recherche puissent tester des architectures de mémoire alternatives dans le même environnement. La revendication réelle de l'article est plus modeste que les chiffres pourraient le suggérer lorsqu'ils sont mis en regard de la concurrence. En divisant la mémoire d'un agent en couches clairement nommées, il est possible de déterminer ultérieurement quelle couche influence quel comportement.
La recherche sur la mémoire efficace pour les agents d'IA est un domaine très actif en ce moment. Le journal de discussion qui grandit à chaque tour rend les modèles plus lents, plus coûteux et moins précis. Les chercheurs appellent ce problème "context rot".
AgenticSTS n'est pas seul à s'attaquer à ce problème. Anthropic utilise Memory Tool et Context Editing pour supprimer automatiquement les résultats d'outils obsolètes du contexte et stocker des informations importantes dans des fichiers externes. Dans leurs propres tests, cela a réduit l'utilisation de tokens pour une recherche web de 100 tours de 84 %. Le cadre chinois GAM divise l'archivage et la récupération entre deux agents spécialisés. Le cadre open-source Mastra condense les conversations en notes textuelles concises stockées en dehors de la fenêtre de contexte, modélisant la façon dont les humains gèrent la mémoire.





