La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Un modèle d’IA pour la science, Faraday, annonce des performances supérieures à 73% sur des tâches de réplication et dépasse des modèles généralistes sur certains cas. De son côté, DiG-bench, un banc de 70 jeux textuels à règles cachées, distingue nettement les systèmes capables de découverte, avec seuls deux modèles franchissant des tâches de niveau 7. Un simulateur de recherche sur l’auto-amélioration récursive et un manifeste de Mark Zuckerberg complètent le tableau des ambitions et des outils du moment.
Faraday dépasse des LLM généralistes sur des réplications
Des chercheurs de la startup Inherent décrivent la construction de Faraday, un modèle d’IA scientifique. L’équipe a mis en place un harnais de supervision et un LLM relativement petit pilotant de grands modèles propriétaires pour améliorer leur efficacité en science. Pour l’évaluer, elle a assemblé un ensemble de 100 articles IA/ML publiés entre 1990 et 2026, convertis en 310 tâches de réplication. Faraday, utilisant Codex, a dépassé des modèles standards comme Opus 4.8 et GPT-5.5 sur certaines de ces tâches. Sur les tâches d’IA en science, il atteint des performances supérieures à 73%.
DiG-bench évalue la découverte dans 70 jeux à règles cachées
DiG-bench propose 70 jeux textuels, conçus par des experts humains, où règles et objectifs sont cachés et doivent être découverts par interaction. Des chercheurs issus notamment d’Oxford, Princeton, KAUST, du Swiss AI Lab, de l’Inria et du MIT ont conçu un dispositif visant à mesurer la capacité à repérer les mécanismes qui déterminent la réussite d’un joueur. La majorité des jeux reste privée, mais 21 sont publics ; la plupart comportent plusieurs niveaux et offrent de 2 à 34 actions possibles, avec un mode optionnel sans limite d’actions. Tous les jeux ont été battus par au moins un humain et sont souvent jugés difficiles, nécessitant des compétences et stratégies variées. Le benchmark est structuré en sept niveaux croissants de difficulté. Opus 5 et Fable 5 avec Claude Code se hissent en tête, seuls à réussir des tâches de niveau 7 ; Opus 5, GPT-5.5 et Kimi K3 valident certaines tâches de niveau 6. Les jeux sont présentés comme assez exigeants pour échapper encore aux modèles actuels, même si certains réalisent des découvertes notables. L’ensemble cherche à isoler un prérequis de la créativité, à savoir la découverte autonome d’éléments utiles dans des situations nouvelles. Dans ce cadre, Fable est également décrit comme montrant une forme d’intuition créative.
Un simulateur explore l’arbitrage entre calcul, chercheurs et données
Paradigm Research met à disposition un jeu qui reproduit la gestion d’une société travaillant sur des systèmes d’IA dotés de capacités d’auto-amélioration récursive. Cet outil permet de comprendre la façon dont s’articulent les différents aspects de la recherche en IA, notamment la répartition des investissements entre les chercheurs et la puissance de calcul, ainsi que les choix relatifs à l’utilisation et au moment de l’exploitation des données.
Zuckerberg détaille ses objectifs pour agents et tutorat
Mark Zuckerberg publie un essai-manifeste, "L’avenir est pour tout le monde", qui expose son approche du développement des systèmes d’IA chez Meta. Il y défend une philosophie d’autonomisation individuelle comme source de prospérité et érige l’invention en finalité de la superintelligence. Ses objectifs affichés incluent un agent personnel très capable pour chacun, des outils pour la génération d’idées, des outils pour créer de nouvelles entreprises et un tuteur personnalisé doté d’un niveau doctorat dans chaque matière.



