Brief IA

Bocconi : GPT-4o améliore les notes, pas l’apprentissage prouvé

🤖 Models & LLM·Tom Levy·

Bocconi : GPT-4o améliore les notes, pas l’apprentissage prouvé

Bocconi : GPT-4o améliore les notes, pas l’apprentissage prouvé
Key Takeaways
1À Bocconi, GPT-4o a ajouté près d’un point aux notes sur 1 à 5.
2Aucun test ultérieur sans ChatGPT n’a mesuré l’apprentissage réel.
3En Chine, une étude sur 30 mois et 26 000 étudiants rapporte 18 à 24 % de baisse aux examens après usage de l’IA.
💡Why it mattersLes barèmes actuels valorisent surtout le polissage et la structure, ce qui rend nécessaire d’adapter l’évaluation si l’on veut mesurer le raisonnement et l’originalité plutôt que la seule production assistée par IA.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

À l’Université Bocconi, un essai randomisé montre que l’accès à GPT-4o fait grimper les notes sur une consigne de marketing, quand une courte leçon de raisonnement causal modifie surtout la manière d’argumenter. Les chercheurs n’ont toutefois pas mesuré d’apprentissage sans ChatGPT. D’autres travaux pointent des gains sur les devoirs mais des reculs aux examens quand l’IA remplace la réflexion.

Aucun test sans IA et un périmètre étroit limitent la portée

Les étudiants n'ont pas été évalués sans ChatGPT après la tâche, ce qui signifie que l'étude mesure une amélioration des notes mais ne démontre pas un apprentissage accru. Il reste incertain si l'avantage observé provient d'une acquisition de connaissances ou d'une meilleure production assistée. L'expérience a porté sur des étudiants de première année d'une seule université et une tâche de marketing spécifique. La répartition aléatoire a été réalisée au niveau de 13 sections de cours, et non individuellement parmi les 1 053 étudiants. Les notes principales ont été attribuées par des correcteurs humains qui ignoraient l'appartenance des textes aux groupes, tandis que des indicateurs comme le raisonnement causal et la diversité des idées ont été évalués à l'aide de modèles d'OpenAI et d'Anthropic. OpenAI a fourni la technologie utilisée, a participé à la recherche, et plusieurs auteurs y travaillent ou y ont travaillé.

Ce que les notes récompensent dans cette tâche

La grille de correction favorisait des réponses conventionnelles. Une production plus importante d'idées, la cohérence des arguments et une diversité interne étaient reliées à des notes plus élevées. À l'opposé, une falsifiabilité accrue, des explications approfondies sur la façon dont les actions proposées fonctionnent et un écart plus marqué par rapport aux idées des pairs étaient associées à des résultats plus faibles. Pour cette tâche, les réponses structurées et conformes à l'espace de solution attendu ont été principalement valorisées lors de la notation. Il faudrait intégrer explicitement la diversité et l'originalité dans les critères d'évaluation pour qu'elles soient vraiment prises en compte, et les barèmes actuels évaluent principalement la qualité de la forme, l'organisation et l'exhaustivité, sans mesurer l'apprentissage ou la compréhension.

Organisation de l’essai et gains chiffrés avec GPT-4o

En novembre 2025, 13 groupes d'un cours d'introduction à la gestion ont été assignés au hasard à l'un des quatre ensembles suivants : groupe témoin, groupe recevant une leçon sur le raisonnement causal, groupe ayant accès à GPT-4o, ou groupe cumulant les deux interventions. Les étudiants avaient pour consigne de rédiger jusqu'à 180 mots de recommandations marketing à destination de la boutique universitaire, la leçon abordant la logique causale, la falsifiabilité et les relations de cause à effet. L'accès à GPT-4o a permis d'obtenir près d'un point de plus sur une échelle de 1 à 5. Les réponses comportaient en moyenne environ deux idées supplémentaires, une cohérence logique accrue et une plus grande proximité avec les recommandations de trois experts. Même après avoir pris en compte la qualité argumentative, le nombre et la diversité des idées ainsi que des propriétés textuelles, un avantage mesurable subsistait, attribué à une meilleure qualité de contenu plutôt qu'à une connaissance accrue des étudiants.

La leçon de raisonnement causal change la nature des réponses

La courte formation au raisonnement causal n'a pas augmenté les scores traditionnels et s'est même accompagnée de notes légèrement inférieures en moyenne. Elle a toutefois amené les étudiants à expliquer pourquoi leurs actions proposées devraient fonctionner, à envisager les conditions d'échec possibles et à produire des idées plus diverses que leurs pairs. Combinée à GPT-4o, elle n'a pas ajouté de points aux scores traditionnels, mais les deux approches se sont révélées complémentaires sur les indicateurs de raisonnement causal, la diversité accrue se maintenant dans le groupe ayant suivi la leçon. Globalement, ChatGPT seul améliore surtout les notes, tandis que la formation en pensée critique modifie le type de raisonnement et d'idées mobilisées.

Autres travaux : gains sur devoirs, chutes aux examens sans IA

Des recherches antérieures montrent que l'effet de l'IA dépend de son usage : lorsqu'elle soutient la réflexion des étudiants, l'impact diffère de celui observé quand elle s'y substitue. Aux États-Unis, l'examen de plus d'un demi-million de notes universitaires a révélé une augmentation des meilleures notes après l'arrivée de ChatGPT, en particulier dans les matières d'écriture et de programmation qui comportent de nombreux devoirs. Des études en environnement contrôlé montrent qu'une fois l'IA retirée, les participants obtiennent des résultats inférieurs à ceux d'un groupe témoin, la diminution étant la plus marquée pour ceux qui utilisaient GPT pour fournir des réponses toutes faites. En Chine, une recherche menée sur 30 mois auprès de plus de 26 000 étudiants a constaté que les devoirs étaient réalisés plus vite et avec de meilleurs résultats grâce à l'IA, mais que les notes aux examens baissaient, les performances ultérieures aux concours d'entrée étant inférieures de 18 à 24 %. Les étudiants qui ont passé autant de temps sur les devoirs que ceux n'utilisant pas l'IA, malgré leur accès à l'outil, n'ont pas présenté de baisses équivalentes.

OpenAI met en avant l’enjeu d’évaluation, les auteurs appellent à récompenser le raisonnement

OpenAI présente ces résultats principalement comme un défi pour les systèmes de notation, l'IA pouvant générer un travail poli et proche de celui d'un expert, ce qui réduit la capacité du produit final à refléter la compréhension réelle des étudiants. Il est recommandé de valoriser l'originalité, le raisonnement et la prise en compte de multiples approches dans les barèmes, et pas seulement les réponses conventionnelles ou soignées. Une telle évolution des critères impliquerait probablement une transformation plus large du système éducatif.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.