Brief IA : Obside défie l'IA avec des paris sur la Coupe du Monde

Obside défie l'IA avec des paris sur la Coupe du Monde

Brief IA
Tom Levy·2 min·2 vues

Obside a testé plusieurs IA sur des paris de la Coupe du Monde, où Mistral, une IA open-source française, a surpassé ses concurrents, y compris GPT 5.5 et DeepSeek V4. Claude Opus 4.8 d'Anthropic a terminé dernier, étant le seul modèle à perdre de l'argent, ce qui soulève des questions sur son efficacité dans des situations d'incertitude.

En bref
1Obside a testé l'efficacité prédictive de plusieurs IA en les faisant parier sur des matchs de football.
2Mistral, une IA open-source française, a surpassé ses concurrents, dont GPT 5.5 et DeepSeek V4.
3Claude Opus 4.8 d'Anthropic a terminé dernier, seul modèle à perdre de l'argent.
💡Pourquoi c'est importantCe test innovant évalue la capacité des IA à prendre des décisions sous incertitude, un défi clé pour leur développement futur.
Le brief IA que lisent les pros

Tu codes avec l’IA ?

Outils, agents et nouveautés dev IA décryptés, chaque soir en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Le CTO de la startup Obside a récemment contacté l'auteur pour partager un benchmark fascinant impliquant plusieurs modèles d'intelligence artificielle dans un exercice de prédiction peu conventionnel : parier sur les matchs de la Coupe du Monde de football. L'objectif était de mesurer leur capacité à prédire des événements futurs de manière efficace.

Pour ce faire, Obside a sélectionné des modèles tels que ChatGPT, Gemini, Claude, Grok, Mistral, DeepSeek et Kimi. Ces IA ont utilisé les cotes en direct fournies par Polymarket pour placer leurs paris. Une heure avant chaque match, les modèles passaient en mode agent, analysant des informations telles que les équipes en lice et les blessures des joueurs, pour décider du montant à parier à partir d'une bankroll virtuelle de 10 000 $.

L'auteur a vérifié les résultats après les demi-finales jeudi, constatant que le modèle Mistral, développé en open-source en France, s'était distingué en prenant la tête du classement, suivi de près par GPT 5.5 d'OpenAI et DeepSeek V4. En revanche, Claude Opus 4.8 d'Anthropic a terminé en bas du classement, étant le seul à avoir perdu de l'argent, ce qui soulève des questions sur son approche éthique du pari.

Cet exercice original vise à tester le jugement des IA dans des situations d'incertitude, un thème que l'auteur a déjà exploré. L'année précédente, ChatGPT avait déjà participé à un tournoi de prévisions organisé par des économistes, sans pour autant surpasser les participants humains moyens. Bien que parier sur le football soit différent, cela reste un moyen innovant d'évaluer la capacité des IA à transformer des informations en ligne en prédictions rentables.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires