Anthropic : GLM-5.3 franchit un seuil en exploitation binaire

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Un test interne sur 100 tâches d'exploitation binaire met en évidence des réussites rares mais réelles pour GLM-5.3, à 4% des essais. Claude Mythos Preview fait mieux, à 6%, tandis que des modèles antérieurs restaient à zéro.
Des générations antérieures à zéro succès, GLM-5.3 montre des percées limitées
Anthropic indique qu'un seuil significatif a été franchi dans les capacités liées à l'exploitation binaire, alors que des modèles antérieurs, dont Claude Opus 4.6 et GLM-5.2, n'enregistraient aucune réussite. Sur ce terrain, GLM-5.3 atteint des détournements de flux de contrôle complets dans 4% des essais, tandis que Claude Mythos Preview grimpe à 6% et surpasse GLM-5.3 dans cette évaluation. Le critère mesuré porte explicitement sur la capacité à réaliser un détournement complet de flux de contrôle, au cœur d'un examen des aptitudes cybernétiques avancées.
Un protocole de 100 tâches aléatoires issues d’un banc interne
L'Anthropic Frontier Red Team a testé plusieurs modèles, dont GLM-5.3 et Claude Mythos Preview, sur 100 tâches tirées d'un étalon interne de Binary Exploitation. Les tâches ont été sélectionnées au hasard, suivant un protocole présenté par l'équipe comme une évaluation des capacités techniques en contexte d'exploitation binaire.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.