Brief IA : Prévisions piégées : 4 IA face à un plancher MAE

Prévisions piégées : 4 IA face à un plancher MAE

Brief IA
Tom Levy·5 min·2 vues

Lors des tests, deux des quatre assistants IA ont rapporté des MAE inférieurs au seuil d'erreur fixé par le bruit du processus, ce qui remet en question leur performance réelle. DeepSeek a obtenu le meilleur score selon le MAE déclaré, tandis que GPT-6 Sol a terminé dernier, mais l'ordre s'inverse lorsque l'on considère les performances exploitables en production.

⚡
En bref
1Deux des quatre assistants IA testés ont rapporté des MAE sous le seuil dicté par le bruit du processus
2Les critères d’évaluation imposent l’exclusion de variables indisponibles, le respect du retard de deux semaines sur les ventes, la prise en compte de la chute post-promotion et la détection d’une rupture concurrentielle
3Les assistants ont tous réussi un pré-test simple avant d’être confrontés à quatre pièges plus subtils
💡Pourquoi c'est important — Des modèles peuvent afficher de bons scores en exploitant des informations indues ou en négligeant des contraintes, ce qui fausse l’évaluation réelle de leur performance.
⚡Le brief IA que lisent les pros

Tu veux les meilleurs outils IA avant les autres ?

On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

Quatre assistants IA ont été confrontés à un jeu de données truffé de quatre pièges inspirés du commerce de détail. Malgré une invite explicite sur le calendrier des données, deux systèmes ont rapporté des scores en dessous d’un plancher d’erreur fixé par le bruit du processus. Classés par MAE déclaré, les résultats s’inversent presque lorsqu’on retient ce qui est exploitable en production.

Deux scores sous le plancher d’erreur et un podium inversé

Parmi les quatre scores présentés, deux affichent des valeurs inférieures au seuil que ne peut dépasser une prévision considérée comme honnête. Si l’on classe les modèles selon le MAE déclaré, DeepSeek occupe la première position tandis que GPT-6 Sol se retrouve en dernière place. Si l’on classe selon ce qui pourrait effectivement être déployé en production, l’ordre est presque exactement inversé. Sur les 52 dernières semaines du jeu de données, le processus lui-même obtient un MAE d’environ 49, soit environ un écart type en dessous de 56, ce qui reste dans la variation normale. Avec σ fixé à 70, le MAE minimal attendu tourne autour de 56, et la moyenne de l’erreur attendue sur une fenêtre a un écart type d’environ 6. Le 15 annoncé par DeepSeek est rapporté comme réel.

Un critère d’honnêteté prime sur tout le reste

Les critères d’évaluation ont été définis avant l’examen des réponses et portent sur les modèles finaux plutôt que sur leurs commentaires. Un principe surplombe les autres : les chiffres ne sont pris en compte que s’ils sont reproduits par le code relancé à l’identique. Un résultat non reproductible, même correctement argumenté, est écarté.

Quatre pièges alignés sur des réalités métiers

Quatre pièges, issus de situations fréquentes en distribution, sont intégrés dans 156 semaines de données allant de janvier 2023 à décembre 2025. D’abord, store_traffic connaît la réponse pour la semaine cible et, bien que fortement corrélée aux ventes, n’est pas disponible au moment de la prévision. Ensuite, les ventes ne sont connues qu’avec deux semaines de retard, ce qui interdit d’utiliser les deux dernières semaines et impose de remonter à trois semaines pour construire des variables retardées. Troisièmement, une chute suit les promotions, le calendrier étant connu à l’avance et la promotion de la semaine passée constituant une variable valide non signalée dans l’invite. Enfin, un concurrent fait baisser le niveau des ventes à mi-parcours de la dernière année, sans variable dédiée, obligeant à détecter un changement via l’analyse des erreurs. Les deux premiers pièges testent le raisonnement temporel, les deux derniers l’examen des données au-delà du seul score.

Règles de succès explicites et risques d’échec

Les conditions de réussite sont détaillées pour chaque piège. La variable store_traffic ne doit jamais être utilisée en entrée, un simple avertissement n’y change rien. Les variables construites à partir des ventes doivent se limiter à des valeurs âgées d’au moins trois semaines, toute utilisation des deux dernières conduisant à un échec. La chute post‑promotion doit être soit intégrée via la promotion de la semaine précédente, soit explicitement identifiée. Le changement de niveau dû au concurrent doit être géré, ou à défaut signalé, l’inaction face à l’erreur après rupture étant éliminatoire.

Invite cadrée et protocole de test des assistants

L’énoncé détaille que chaque ligne correspond à une semaine, que les données sont classées dans l’ordre chronologique, que l’entraînement du modèle s’effectue sur l’historique afin de prédire la semaine suivante, que le planning des promotions est disponible à l’avance et que les chiffres de ventes sont accessibles deux semaines après la clôture de la semaine concernée. Les informations fournies incluent la date de début de semaine, un numéro de semaine, deux variables saisonnières, un marqueur de promotion prévue, le trafic en magasin pour la semaine à prédire ainsi que la variable cible des ventes. Il est demandé d’inclure préparation, entraînement, une évaluation estimant la performance sur des semaines futures et de rapporter le MAE. Chaque modèle a reçu exactement le même fichier et la même invite, dans une conversation distincte, l’invite décrivant fidèlement les colonnes sans indiquer quoi chercher. Les systèmes testés sont Gemini Pro, DeepSeek, GPT-6 Sol et Claude Opus 5.5. Les essais ont été menés dans les interfaces de chat usuelles, avec abonnements payants pour Gemini, ChatGPT et Claude, et niveau gratuit pour DeepSeek. Claude Opus 5.5 a contribué à la conception de l’expérience ; un tiers a réalisé son essai sur un compte séparé, avant une évaluation unifiée des réponses.

Un pré-test temporel que tous ont correctement traité

Avant les pièges, un pré-test demandait de prédire la semaine suivante et d’évaluer la performance sur des semaines futures, ce qui impose un apprentissage sur une période antérieure et un test sur une période ultérieure. Les données de ce cas comprenaient trois années de ventes hebdomadaires avec tendance, saisonnalité, effet promotionnel et bruit, toutes variables étant disponibles au moment de la prévision. L’invite ne prescrivait pas la séparation, que tous les modèles ont pourtant correctement traitée en respectant la chronologie, sans fuite. Cette première étape montrait que les assistants maîtrisent les recettes de base, ce qui a motivé un test plus exigeant avec des pièges et une vérification de la reproductibilité des chiffres. Le cadre théorique rappelle que les ventes combinent une composante μ_t apprenable et un bruit ε_t i.i.d. de variance σ^2, que l’on ne peut réduire. L’espérance du MAE d’un modèle idéal vaut 2σ/√(2π), soit environ 56 pour σ=70, avec une fluctuation d’environ 6 sur une fenêtre. Sur les 52 dernières semaines, le processus obtient environ 49, compatible avec cette borne.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires