La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Sequent : Une initiative pour l'alignement des IA superintelligentes
Des chercheurs du UK AI Security Institute et de la startup Timaeus ont lancé une nouvelle organisation à but non lucratif, Sequent, dédiée à la recherche sur l'alignement des systèmes d'intelligence artificielle superintelligents. Leur mission est de développer des techniques qui augmentent la confiance dans la sécurité de ces systèmes. Selon eux, bien que l'intelligence artificielle superintelligente puisse être développée dans les années à venir, il est incertain que l'alignement suive le même rythme. Ils soulignent que les programmes actuels des laboratoires d'IA ne fournissent pas de garanties suffisantes avant l'entraînement de ces systèmes.
Sequent prévoit de recruter entre 40 et 80 employés à temps plein dans les prochaines années et cherche à lever entre 100 et 150 millions de dollars initialement. Ils se préparent également à lever des fonds supplémentaires si leurs recherches parallèles s'avèrent fructueuses.
Un portefeuille de recherches diversifiées
Sequent adopte une approche distincte par rapport aux grands laboratoires d'IA, cherchant à établir des raisons fondées de croire que l'alignement observé dans des environnements contrôlés peut être généralisé à des situations plus complexes. Les domaines de recherche incluent la surveillance évolutive, la théorie de l'apprentissage, les arguments heuristiques, la théorie des jeux et les personas. L'objectif est de favoriser des interactions prometteuses entre ces différentes approches.
L'importance de l'alignement avant l'amélioration autonome
Actuellement, les systèmes d'IA présentent des défauts d'alignement qui peuvent entraîner des échecs inattendus. Bien que ces échecs soient acceptables à ce stade, il devient crucial de développer de meilleures techniques d'alignement à mesure que les systèmes d'IA deviennent plus intelligents et que les humains commencent à leur déléguer davantage de recherches fondamentales.
ChinaHeritaQA : Un benchmark pour le raisonnement culturel
Des chercheurs de plusieurs universités ont mis au point ChinaHeritaQA, un ensemble de données multimodal destiné à évaluer les capacités de raisonnement culturel des modèles de vision-langage. Ce dataset comprend 2 279 images de 51 sites du patrimoine mondial de l'UNESCO en Chine, accompagnées de 14 133 paires de questions-réponses en chinois et en anglais. Les questions couvrent divers aspects tels que la reconnaissance d'identité, l'ancrage visuel, la contextualisation historique, et l'analyse architecturale. Les modèles à poids ouverts surpassent déjà les humains, avec une précision moyenne de 67 % pour les humains contre 81 % pour le modèle le mieux noté.
FrontierCode : Un benchmark de codage avancé
Cognition, créateur de Devin, a introduit FrontierCode, un benchmark de codage particulièrement exigeant. Ce benchmark se compose de 150 tâches réparties en trois niveaux de difficulté : Diamond, Main, et Extended. Le score de 13,4 % obtenu par Claude Opus 4.8 sur le composant le plus difficile illustre la complexité de ce benchmark. Les langages testés incluent Python, Go, TypeScript, JavaScript, Java, et C/C++.
L'importance des évaluations rigoureuses
Les évaluations difficiles comme FrontierCode sont essentielles pour mesurer les progrès rapides de l'IA. Il est prévu que des systèmes atteignent 70 % ou plus sur le niveau Diamond d'ici juin 2027. Ces benchmarks pourraient durer plus longtemps que d'autres récents, fournissant une base solide pour évaluer les capacités des systèmes d'IA.
Xiaomi et son modèle ultra-rapide
La société technologique Xiaomi a dévoilé le Xiaomi MiMo-V2.5-Pro-UltraSpeed, un modèle de 1 trillion de paramètres capable de traiter 1000 tokens par seconde. Cette performance est le résultat d'une co-conception du modèle avec la pile logicielle, utilisant des techniques comme la quantification FP4.


