Brief IA : Qwen3.8 Max d'Alibaba rivalise avec Claude Opus 4.8

Qwen3.8 Max d'Alibaba rivalise avec Claude Opus 4.8

Brief IA
Tom Levy·2 min·7 vues

Qwen3.8 Max d'Alibaba a atteint un score de 56 sur l'Indice d'Analyse de l'Intelligence Artificielle, progressant de 10 points par rapport à Qwen3.7 Max. Cependant, Kimi K3 reste le leader avec un score de 57 et des coûts réduits de 25 %, tandis que Qwen3.8 Max nécessite 64 étapes par tâche, ce qui le rend plus lent et coûteux.

En bref
1Qwen3.8 Max d'Alibaba atteint un score de 56 sur l'Indice d'Analyse de l'Intelligence Artificielle, marquant une progression de 10 points.
2Malgré cette avancée, Kimi K3 surpasse toujours Qwen3.8 Max et Claude Opus 4.8 en termes de performances.
3Kimi K3 offre une performance supérieure tout en réduisant les coûts de 25 % par rapport à ses concurrents.
💡Pourquoi c'est importantL'amélioration de Qwen3.8 Max montre la compétitivité croissante d'Alibaba, mais Kimi K3 reste le leader en efficacité et coût.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Qwen3.8 Max d'Alibaba rivalise avec Claude Opus 4.8

Qwen3.8 Max obtient un score de 56 sur l'Index d'Analyse de l'Intelligence Artificielle, soit une augmentation de 10 points par rapport à Qwen3.7 Max (46). Selon Artificial Analysis, cela le place au même niveau que Claude Opus 4.8 et devant GLM-5.2 (51), mais derrière Kimi K3 (57), qui coûte également 25 % moins cher.

Sur le GDPval-AA, un benchmark pour les tâches liées au travail, Qwen grimpe de 468 points Elo à 1 739, dépassant Kimi K3 (1 685). Seul Claude Opus 5 (1 852) obtient un score plus élevé. Le problème réside dans la manière dont il atteint ce score. Qwen3.8 Max nécessite 64 étapes par tâche au lieu de 14, et les tokens d'entrée ont augmenté de 15 fois car le test renvoie l'historique complet de la conversation au modèle à chaque étape.

Le modèle fonctionne de manière plus approfondie mais est plus lent et coûte plus cher. Le rapport qualité-prix d'Alibaba en prend un coup malgré la baisse des prix des tokens (l'entrée est passée de 2,50 $ à 2,00 $ par million de tokens, la sortie de 7,50 $ à 6,00 $, et les hits de cache de 0,50 $ à 0,25 $). Une seule tâche dans l'Intelligence Index coûte désormais 1,14 $, soit plus du double de Qwen3.7 Max (0,53 $). Kimi K3 obtient un point de plus à seulement 0,86 $ par tâche, et GLM-5.2 se situe à 0,57 $.

Il y a également des régressions par rapport à la version précédente. L'AA-LCR a chuté de 2 points, un test qui vérifie si un modèle peut correctement rassembler des informations à partir de textes très longs. L'AA-Omniscience a baissé de 10 points, mesurant si un modèle répond correctement aux questions de connaissance ou admet honnêtement qu'il ne sait pas. Le taux de précision reste autour de 31 %, mais le taux de hallucination a grimpé de 23 % à 40 %. Qwen3.8 Max devine beaucoup plus souvent au lieu de dire qu'il ne sait pas.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires