Brief IA : Sequent et FrontierCode : IA sécurisée et codage avancé

Sequent et FrontierCode : IA sécurisée et codage avancé

Brief IA
Tom Levy·3 min·9 vues

L'import AI 461 souligne que l'alignement en intelligence artificielle n'est pas sur la bonne voie, avec des préoccupations croissantes sur la sécurité des systèmes d'IA superintelligents. Une nouvelle organisation de recherche, Sequent, a été créée par le UK AI Security Institute et la startup Timaeus pour développer des techniques d'alignement, visant à atteindre 40 à 80 employés et à lever entre 100 et 150 millions de dollars dans les prochaines années.

En bref
1Sequent, fondé par le UK AI Security Institute et Timaeus, vise à améliorer l'alignement des IA superintelligentes.
2FrontierCode, créé par Cognition, propose un benchmark de codage avec un score de 13,4 % pour Claude Opus 4.8.
3ChinaHeritaQA évalue les capacités culturelles des modèles IA avec 2 279 images de sites du patrimoine chinois.
💡Pourquoi c'est importantCes initiatives renforcent la sécurité et l'évaluation des IA, cruciales pour leur intégration future dans des tâches complexes.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Sequent : Une initiative pour l'alignement des IA superintelligentes

Des chercheurs du UK AI Security Institute et de la startup Timaeus ont lancé une nouvelle organisation à but non lucratif, Sequent, dédiée à la recherche sur l'alignement des systèmes d'intelligence artificielle superintelligents. Leur mission est de développer des techniques qui augmentent la confiance dans la sécurité de ces systèmes. Selon eux, bien que l'intelligence artificielle superintelligente puisse être développée dans les années à venir, il est incertain que l'alignement suive le même rythme. Ils soulignent que les programmes actuels des laboratoires d'IA ne fournissent pas de garanties suffisantes avant l'entraînement de ces systèmes.

Sequent prévoit de recruter entre 40 et 80 employés à temps plein dans les prochaines années et cherche à lever entre 100 et 150 millions de dollars initialement. Ils se préparent également à lever des fonds supplémentaires si leurs recherches parallèles s'avèrent fructueuses.

Un portefeuille de recherches diversifiées

Sequent adopte une approche distincte par rapport aux grands laboratoires d'IA, cherchant à établir des raisons fondées de croire que l'alignement observé dans des environnements contrôlés peut être généralisé à des situations plus complexes. Les domaines de recherche incluent la surveillance évolutive, la théorie de l'apprentissage, les arguments heuristiques, la théorie des jeux et les personas. L'objectif est de favoriser des interactions prometteuses entre ces différentes approches.

L'importance de l'alignement avant l'amélioration autonome

Actuellement, les systèmes d'IA présentent des défauts d'alignement qui peuvent entraîner des échecs inattendus. Bien que ces échecs soient acceptables à ce stade, il devient crucial de développer de meilleures techniques d'alignement à mesure que les systèmes d'IA deviennent plus intelligents et que les humains commencent à leur déléguer davantage de recherches fondamentales.

ChinaHeritaQA : Un benchmark pour le raisonnement culturel

Des chercheurs de plusieurs universités ont mis au point ChinaHeritaQA, un ensemble de données multimodal destiné à évaluer les capacités de raisonnement culturel des modèles de vision-langage. Ce dataset comprend 2 279 images de 51 sites du patrimoine mondial de l'UNESCO en Chine, accompagnées de 14 133 paires de questions-réponses en chinois et en anglais. Les questions couvrent divers aspects tels que la reconnaissance d'identité, l'ancrage visuel, la contextualisation historique, et l'analyse architecturale. Les modèles à poids ouverts surpassent déjà les humains, avec une précision moyenne de 67 % pour les humains contre 81 % pour le modèle le mieux noté.

FrontierCode : Un benchmark de codage avancé

Cognition, créateur de Devin, a introduit FrontierCode, un benchmark de codage particulièrement exigeant. Ce benchmark se compose de 150 tâches réparties en trois niveaux de difficulté : Diamond, Main, et Extended. Le score de 13,4 % obtenu par Claude Opus 4.8 sur le composant le plus difficile illustre la complexité de ce benchmark. Les langages testés incluent Python, Go, TypeScript, JavaScript, Java, et C/C++.

L'importance des évaluations rigoureuses

Les évaluations difficiles comme FrontierCode sont essentielles pour mesurer les progrès rapides de l'IA. Il est prévu que des systèmes atteignent 70 % ou plus sur le niveau Diamond d'ici juin 2027. Ces benchmarks pourraient durer plus longtemps que d'autres récents, fournissant une base solide pour évaluer les capacités des systèmes d'IA.

Xiaomi et son modèle ultra-rapide

La société technologique Xiaomi a dévoilé le Xiaomi MiMo-V2.5-Pro-UltraSpeed, un modèle de 1 trillion de paramètres capable de traiter 1000 tokens par seconde. Cette performance est le résultat d'une co-conception du modèle avec la pile logicielle, utilisant des techniques comme la quantification FP4.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires