Grok 4.6 de SpaceXAI défie OpenAI et Anthropic dans l'IA

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Grok 4.6 de SpaceXAI défie OpenAI et Anthropic dans l'IA
SpaceXAI dévoile Grok 4.6 et le positionne au même niveau que les meilleurs modèles d'OpenAI et d'Anthropic, avec des chiffres à l'appui. Ces données, choisies, compilées et publiées par SpaceXAI elle-même, incitent à la prudence.
Deux mois après avoir absorbé Cursor et au lendemain du lancement de son agent Grok Bot, SpaceXAI continue de progresser sur le terrain des modèles de pointe. L'entreprise d'Elon Musk a présenté le 12 août Grok 4.6, un modèle conçu pour les agents de longue durée, le code et le travail de bureau. Le tableau de benchmarks qui l'accompagne le place dans la même catégorie que GPT-5.6 Sol et Claude Fable 5. Cependant, le conditionnel est de mise, et la suite de cet article explique pourquoi.
Une égalité revendiquée, des trous dans la raquette
Sur l'indice composite d'Artificial Analysis (neuf évaluations agrégées), Grok 4.6 afficherait 61 points. Cela lui permet de revendiquer une égalité parfaite avec GPT-5.6 Sol à son niveau de raisonnement maximal, et un léger retard d'un point sur Fable 5 Max. Le bond est réel par rapport à Grok 4.5, qui était crédité de 56 points sur le même indice, et le modèle prendrait même la tête sur certaines épreuves de travail professionnel comme GDPVal-AA.
Cependant, le tableau d'ensemble ressemble moins à une victoire qu'à une admission dans le club. Sur Terminal-Bench, une évaluation en ligne de commande, Grok 4.6 plafonnerait à 26 %, tandis que ses deux rivaux dépassent les 34 %. Ce retard se confirmerait également sur DeepSWE, un test d'ingénierie logicielle.
Surtout, SpaceXAI précise que les scores des concurrents proviennent de leurs fiches techniques et des classements publics, sans que les modèles rivaux aient été réexécutés dans des conditions identiques. Un tableau de benchmarks publié par un éditeur reste un bulletin scolaire rédigé par l'élève : les notes ne sont pas forcément fausses, mais le choix des matières affichées lui appartient. L'industrie a déjà fait l'expérience de cette situation avec la controverse des benchmarks de Llama 4, qui est devenue un cas d'école.
Le vrai benchmark est sur la grille tarifaire
Ce lancement illustre moins une course à l'intelligence qu'une stratégie commerciale. Grok 4.6 est facturé 2 dollars le million de tokens en entrée et 6 dollars en sortie. En comparaison, GPT-5.6 Sol affiche 5 et 30 dollars sur la même grille, tandis que Fable 5 monte à 10 et 50 dollars. Pour les utilisateurs abonnés, cela peut sembler anodin. En revanche, pour les entreprises qui utilisent ces modèles à une échelle beaucoup plus grande, l'enjeu est tout autre.
Le modèle arrive directement dans Cursor, dans Grok Build et via l'API, avec un quota doublé la première semaine, comme une période d'essai grandeur nature. Cette manœuvre prolonge le rachat de Cursor et le développement conjoint entamé cet été. SpaceXAI ne cherche pas à convaincre les jurys de benchmarks, mais les développeurs qui paient la facture d'API à la fin du mois.
L'histoire invite également à la patience. Grok 4 avait pris la tête du classement d'Artificial Analysis en juillet 2025, avant que la hiérarchie ne se réorganise au fil des sorties concurrentes. Sa mise à disposition gratuite en France avait déjà illustré cette approche par le volume plutôt que par le prestige. Pour les développeurs français, l'équation du jour repose sur un modèle qui coûterait plusieurs fois moins cher que ses rivaux directs, pour des performances annoncées comme voisines. Reste aux évaluations indépendantes à confirmer (ou non) la deuxième moitié de la promesse.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.