Brief IA

Grok 4.6 de SpaceXAI défie OpenAI et Anthropic dans l'IA

🛠️ AI Tools·Tom Levy·

Grok 4.6 de SpaceXAI défie OpenAI et Anthropic dans l'IA

Grok 4.6 de SpaceXAI défie OpenAI et Anthropic dans l'IA
Key Takeaways
1SpaceXAI a lancé Grok 4.6, un modèle d'IA qu'elle compare aux leaders du secteur comme OpenAI et Anthropic.
2Les performances de Grok 4.6 sont mises en avant par SpaceXAI, mais les données proviennent de l'entreprise elle-même.
3La prudence est de mise quant à l'évaluation de ces chiffres, qui nécessitent une analyse critique indépendante.
💡Why it mattersL'arrivée de Grok 4.6 pourrait intensifier la concurrence dans le secteur de l'IA, mais la fiabilité des données reste à vérifier.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Grok 4.6 de SpaceXAI défie OpenAI et Anthropic dans l'IA

SpaceXAI dévoile Grok 4.6 et le positionne au même niveau que les meilleurs modèles d'OpenAI et d'Anthropic, avec des chiffres à l'appui. Ces données, choisies, compilées et publiées par SpaceXAI elle-même, incitent à la prudence.

Deux mois après avoir absorbé Cursor et au lendemain du lancement de son agent Grok Bot, SpaceXAI continue de progresser sur le terrain des modèles de pointe. L'entreprise d'Elon Musk a présenté le 12 août Grok 4.6, un modèle conçu pour les agents de longue durée, le code et le travail de bureau. Le tableau de benchmarks qui l'accompagne le place dans la même catégorie que GPT-5.6 Sol et Claude Fable 5. Cependant, le conditionnel est de mise, et la suite de cet article explique pourquoi.

Une égalité revendiquée, des trous dans la raquette

Sur l'indice composite d'Artificial Analysis (neuf évaluations agrégées), Grok 4.6 afficherait 61 points. Cela lui permet de revendiquer une égalité parfaite avec GPT-5.6 Sol à son niveau de raisonnement maximal, et un léger retard d'un point sur Fable 5 Max. Le bond est réel par rapport à Grok 4.5, qui était crédité de 56 points sur le même indice, et le modèle prendrait même la tête sur certaines épreuves de travail professionnel comme GDPVal-AA.

Cependant, le tableau d'ensemble ressemble moins à une victoire qu'à une admission dans le club. Sur Terminal-Bench, une évaluation en ligne de commande, Grok 4.6 plafonnerait à 26 %, tandis que ses deux rivaux dépassent les 34 %. Ce retard se confirmerait également sur DeepSWE, un test d'ingénierie logicielle.

Surtout, SpaceXAI précise que les scores des concurrents proviennent de leurs fiches techniques et des classements publics, sans que les modèles rivaux aient été réexécutés dans des conditions identiques. Un tableau de benchmarks publié par un éditeur reste un bulletin scolaire rédigé par l'élève : les notes ne sont pas forcément fausses, mais le choix des matières affichées lui appartient. L'industrie a déjà fait l'expérience de cette situation avec la controverse des benchmarks de Llama 4, qui est devenue un cas d'école.

Le vrai benchmark est sur la grille tarifaire

Ce lancement illustre moins une course à l'intelligence qu'une stratégie commerciale. Grok 4.6 est facturé 2 dollars le million de tokens en entrée et 6 dollars en sortie. En comparaison, GPT-5.6 Sol affiche 5 et 30 dollars sur la même grille, tandis que Fable 5 monte à 10 et 50 dollars. Pour les utilisateurs abonnés, cela peut sembler anodin. En revanche, pour les entreprises qui utilisent ces modèles à une échelle beaucoup plus grande, l'enjeu est tout autre.

Le modèle arrive directement dans Cursor, dans Grok Build et via l'API, avec un quota doublé la première semaine, comme une période d'essai grandeur nature. Cette manœuvre prolonge le rachat de Cursor et le développement conjoint entamé cet été. SpaceXAI ne cherche pas à convaincre les jurys de benchmarks, mais les développeurs qui paient la facture d'API à la fin du mois.

L'histoire invite également à la patience. Grok 4 avait pris la tête du classement d'Artificial Analysis en juillet 2025, avant que la hiérarchie ne se réorganise au fil des sorties concurrentes. Sa mise à disposition gratuite en France avait déjà illustré cette approche par le volume plutôt que par le prestige. Pour les développeurs français, l'équation du jour repose sur un modèle qui coûterait plusieurs fois moins cher que ses rivaux directs, pour des performances annoncées comme voisines. Reste aux évaluations indépendantes à confirmer (ou non) la deuxième moitié de la promesse.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.