OpenAI : les agents de codage révolutionnent la recherche scientifique

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
OpenAI et l'optimisation des logiciels scientifiques
OpenAI a récemment publié un rapport détaillant l'impact des agents de codage sur huit projets de calcul scientifique. Ces projets ont démontré comment ces agents peuvent considérablement réduire les temps d'exécution. Le rapport met en lumière l'utilisation de Codex dans cinq projets, tandis que trois autres ont combiné Codex avec d'autres outils. Il est essentiel de noter que ce rapport émane d'un fournisseur et se base sur des études de cas fournies par les contributeurs eux-mêmes.
Malgré cela, le rapport offre un aperçu précieux des défis de maintenance des logiciels de recherche. Souvent développés pour accompagner un seul article, ces logiciels sont créés par de petites équipes académiques sans le soutien d'ingénieurs dédiés, ce qui entraîne une accumulation de dette technique que peu ont les moyens de rembourser.
Le rapport d'OpenAI affirme que les agents de codage peuvent s'attaquer à cette dette technique. Les huit projets couverts dans le rapport incluent des domaines variés tels que la génomique, l'immunologie, les statistiques et le séquençage de l'ARN.
Les catégories de tâches des agents
Les agents de codage ont été impliqués dans trois types de tâches principales : le nettoyage des systèmes de packaging et de construction, l'optimisation des performances sur le code existant, et le portage complet de langages ou de backend.
-
Dans le cas de cyvcf2, une bibliothèque Python pour lire des fichiers de variantes génomiques, un ancien système de construction et de packaging a été remplacé par un processus plus moderne et unifié. Brent Pedersen, un contributeur, souligne que bien que les agents permettent une rapidité d'exécution, l'avancée scientifique nécessite toujours une expertise humaine et une attention particulière.
-
HI.SIM, un simulateur de lectures de séquençage ADN, a bénéficié de deux optimisations autonomes qui ont réduit le temps d'exécution de 31 % sans altérer les résultats. Andrew Ho, qui ne se considère ni comme un spécialiste de la génomique ni comme un programmeur en C, a décrit le résultat comme « magique » du point de vue de l'utilisateur final, ayant auparavant perdu du temps à cause de bugs de performance qu'il ne pouvait résoudre seul.
-
Pour Hifiasm, utilisé dans l'assemblage de génomes à partir de lectures PacBio HiFi, une réduction de 25 % a été obtenue sur l'objectif d'optimisation, et environ 15 % sur des données de séquençage humain séparées. Suyash Shringarpure, un contributeur, a noté que l'agent pouvait établir sa propre structure de référence et proposer des candidats de manière indépendante, bien que l'orientation humaine reste nécessaire pour éviter les modes d'échec répétés.
-
MHCflurry, qui prédit les fragments de protéines présentés aux cellules T, a migré son backend de TensorFlow/Keras à PyTorch tout en maintenant la compatibilité avec les poids de modèle précédemment publiés. Les contributeurs Alex Rubinsteyn, Sergey Feldman et Timothy O'Donnell ont décrit ce changement comme une « maintenance peu glamour et laborieuse » essentielle pour la survie des projets scientifiques open source.
-
bayesm-rs, un port Rust des modèles statistiques du package bayesm de R, a égalé les estimations du logiciel original avec une tolérance prédéfinie et a fonctionné 2,3 à 2,7 fois plus vite sur un seul thread processeur, atteignant 4,4 à 9,5 fois plus vite sur huit threads. Les contributeurs Andrew Bai et Andrew Ho ont noté que les agents ont géré rapidement et correctement les références directes, mais les extensions nécessitant un jugement statistique ont nécessité une validation humaine.
Innovations avec Rust et GPU
Trois autres projets, rustar-aligner, svb, et kuva, ont impliqué des constructions Rust réalisées avec des agents de codage, y compris une recréation complète de STAR, un outil d'alignement de séquences d'ARN qui avait perdu sa maintenance active. James M. Ferguson, un contributeur, a expliqué que les agents changent ce qui est réalisable : réécrire un aligneur de 20 000 lignes à la main est inefficace, mais avec un agent, cela devient un travail réalisable en quelques semaines. Cependant, la vérification reste une tâche humaine, nécessitant l'examen de plus de 900 graphiques avant publication.
RustQC a consolidé 15 outils de contrôle qualité de séquençage d'ARN en un seul programme, réduisant le temps d'exécution par 60 fois et l'entrée/sortie disque par 25 fois. Les reconstructions associées FastQC-Rust et Trim Galore ont fonctionné respectivement sept et trois fois plus vite tout en préservant le comportement des outils originaux. Phil Ewels, un contributeur, a souligné que bien que la technologie soit la partie facile, la gestion des divergences de comportement entre outils reste un défi.
HelixForge, une reconstruction native GPU de l'outil de simulation de mutations BAMSurgeon, a réduit le temps d'exécution d'environ 60 fois sur un benchmark avec des données humaines réelles. Les contributeurs Mamad Ahangari, Varun Goyal et Hassan Masoudi ont affirmé que cela a produit des fréquences de mutations plus précises et résolu plusieurs bugs de l'outil original.
La vérification humaine, un impératif
Le rapport révèle que bien que les agents de codage soient efficaces pour gérer des demandes d'implémentation bien définies, ils ne peuvent pas juger de la validité scientifique de leur propre sortie. Les contributeurs ont observé que les agents expriment une confiance dans des travaux contenant des erreurs, transférant ainsi la responsabilité de la vérification aux humains. Cela implique des tests d'acceptation rigoureux : correspondance exacte des sorties, vérifications de parité avec des outils existants, ou validation à l'aide de données simulées.
Les projets ont généralement progressé par étapes, avec des agents produisant des ébauches rapides, tandis que les humains se concentraient sur les cas limites et les divergences numériques subtiles qu'un simple benchmark n'aurait pas détectées.
La réduction des coûts d'ingénierie a des effets ambivalents. Elle permet à de petites équipes de réaliser des projets qui auraient auparavant nécessité un financement important, mais elle facilite également la création de versions incompatibles d'un même outil par différents laboratoires. Les modifications apportées à MHCflurry et cyvcf2 ont été réintégrées dans leurs projets d'origine, tandis que rustar-aligner a été transféré à une nouvelle gestion communautaire en raison de l'abandon de l'outil original.
Le rapport d'OpenAI met en avant l'importance de déterminer la propriété d'un outil reconstruit et de sécuriser cet engagement avant même que la première ligne de code générée par un agent ne soit écrite.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.