OpenAI : 30 % des tâches de SWE-Bench Pro jugées défaillantes
OpenAI a révélé que 30 % des tâches de SWE-Bench Pro, un test de codage pour l'évaluation des IA, sont défaillantes. En réponse, l'entreprise a décidé de retirer son soutien à cette référence, soulignant des lacunes dans l'évaluation des compétences en programmation.
Cette annonce survient alors que la précision des modèles d'IA est sous pression croissante pour répondre aux exigences du marché technologique. Les entreprises cherchent des évaluations fiables pour garantir la qualité des systèmes d'IA.
Les professionnels de l'IA doivent désormais reconsidérer les outils d'évaluation de compétences pour garantir la fiabilité de leurs modèles. Cela pourrait influencer les choix d'outils et de méthodologies dans le développement de l'IA.
“OpenAI retire son soutien à SWE-Bench Pro en raison de 30 % de défaillances.”
👥 Pour : CTO, responsables de l'évaluation des compétences, développeurs IA, chefs de projet technologique
Lire l'article complet