Brief IA : Kimi K3 défie GPT-5.6 Sol et Fable 5 avec son modèle révolutionnaire

Kimi K3 défie GPT-5.6 Sol et Fable 5 avec son modèle révolutionnaire

Brief IA
Tom Levy·6 min·171 vues

Kimi a lancé K3, un modèle multimodal à poids ouverts avec 2,8 trillions de paramètres, qui se rapproche des performances de Claude Fable 5 et GPT 5.6 Sol. Les poids complets de K3 seront publiés le 27 juillet, et le modèle est plus coûteux que ses prédécesseurs, avec des tarifs de 3 $ par million de tokens d'entrée et 15 $ par million de tokens de sortie.

En bref
1Kimi a dévoilé K3, un modèle multimodal à poids ouverts doté de 2,8 trillions de paramètres.
2K3 se rapproche des performances de Claude Fable 5 et GPT 5.6 Sol, surpassant Opus 4.8 et GLM 5.2.
3Le modèle K3 est plus coûteux que ses prédécesseurs, avec une publication des poids prévue pour le 27 juillet.
💡Pourquoi c'est importantK3 pourrait redéfinir les standards de l'IA, marquant un tournant dans la compétition technologique mondiale.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Kimi K3 défie GPT-5.6 Sol et Fable 5 avec son modèle révolutionnaire

Kimi a lancé K3, un modèle multimodal à poids ouverts construit sur une architecture de mélange d'experts avec 896 experts, 2,8 trillions de paramètres, et une fenêtre de contexte d'un million de tokens. Les poids complets sont attendus d'ici la fin juillet.

Dans les propres benchmarks de Kimi, K3 se rapproche de Claude Fable 5 et GPT 5.6 Sol, mais surpasse tous les autres systèmes testés de manière significative. Des tests indépendants réalisés par Artificial Analysis confirment largement ces résultats, bien que le taux d'hallucination de K3 ait augmenté par rapport à son prédécesseur.

À 3 $ par million de tokens d'entrée et 15 $ par million de tokens de sortie, K3 est beaucoup plus cher que son prédécesseur mais comparable à des modèles occidentaux de milieu de gamme comme Sonnet 5. Les coûts par tâche s'élèvent à environ 0,94 $, similaire à GPT-5.6 Sol et environ la moitié du prix d'Opus 4.8.

Kimi décrit K3 comme le premier modèle ouvert dans la fourchette d'environ 3 trillions de paramètres. Le modèle cible des tâches de programmation de longue durée, le travail de connaissance et le raisonnement complexe.

Dans les benchmarks de Kimi, K3 reste derrière les modèles propriétaires de pointe Claude Fable 5 et GPT 5.6 Sol, mais surpasse tous les autres systèmes testés, y compris les modèles Claude Opus et le rival chinois GLM-5.2. Tous les résultats proviennent de Kimi et ont été obtenus à une intensité de réflexion maximale ou élevée, selon l'entreprise.

Kimi K3 remporte deux des six benchmarks de programmation et se classe deuxième ou troisième dans les autres.

Performances et évaluations

Parmi les agents généraux, Kimi K3 remporte trois des six tests. Fable 5 occupe la première place dans les deux tests d'agents visuels.

À travers tous les 35 tests, K3 a pris la première place environ sept fois et s'est classé deuxième ou troisième dans la plupart des autres. Fable 5 a remporté le plus de tests individuels. Dans presque tous les benchmarks, K3 a largement dépassé Opus 4.8, GPT 5.5 et GLM 5.2. Selon le benchmark, l'un des trois systèmes d'agents a été utilisé : KimiCode, Claude Code ou Codex, ce qui signifie que les résultats n'ont pas été tous collectés dans des conditions identiques.

Artificial Analysis a publié sa première évaluation de Kimi K3. Le modèle obtient un score de 57 sur l'Artificial Analysis Intelligence Index, le plaçant à égalité avec Opus 4.8 et GPT-5.5, mais toujours derrière Fable 5 et GPT-5.6 Sol. Cela correspond largement aux affirmations de Kimi.

Sur les tâches d'agents, K3 atteint un classement Elo de 1 668 sur GDPval v2, un grand bond par rapport à K2.6 qui était de 1 190. Il surpasse GLM-5.2 (1 514), GPT-5.5 (1 494) et Claude Opus 4.8 (1 600), bien qu'il soit toujours en deçà de Claude Fable 5 (1 760). K3 se classe également au premier rang sur AutomationBench-AA, la version d'Artificial Analysis de l'évaluation des flux de travail SaaS d'agent de Zapier, avec un score de 53 %.

Sur AA-Briefcase, une évaluation privée du travail de connaissance à long terme, K3 atteint un Elo global de 1 547, en hausse de 732 points par rapport à K2.6. Seul Claude Fable 5 obtient un score plus élevé. Artificial Analysis qualifie K3 de bien équilibré, avec un score de grille et une qualité analytique proches de celles de Fable 5. Cependant, GPT-5.6 Sol reste en tête en termes de qualité de présentation.

Le taux de précision de K3 s'est amélioré, passant de 33 % à 46 % sur l'AA-Omniscience Index, faisant passer le score global de +6 à +18. Mais son taux d'hallucination a grimpé de 39 % à 51 %, ce qui signifie que K3 fabrique plus de réponses même s'il répond correctement à plus de questions.

Cas d'utilisation et architecture

Selon Kimi, le principal cas d'utilisation du modèle est le développement logiciel de longue durée avec une supervision humaine minimale. K3 est conçu pour analyser de grands codebases, coordonner des outils de terminal et rester concentré sur une tâche à travers de nombreuses étapes de travail.

Le modèle associe la programmation à un retour visuel : il examine des captures d'écran, modifie le code, puis vérifie la sortie visible. Kimi appelle ce système en boucle fermée "Vision in the Loop" et le positionne comme une base pour le développement de jeux, la conception d'interface utilisateur et le CAD.

K3 utilise une architecture de mélange d'experts qui active seulement 16 des 896 experts à la fois. Il est associé à une nouvelle architecture d'attention appelée Kimi Delta Attention, qui, selon Kimi, permet un décodage jusqu'à 6,3 fois plus rapide pour des contextes d'un million de tokens. Les "résidus d'attention" augmenteraient l'efficacité de l'entraînement d'environ 25 % tout en ajoutant moins de 2 % de surcharge de calcul supplémentaire.

Tarification et disponibilité

Selon la documentation de l'API Kimi, un million de tokens d'entrée coûte 0,30 $ avec un cache et 3,00 $ sans. Un million de tokens de sortie, y compris le raisonnement, coûte 15,00 $. Ces prix s'appliquent indépendamment de la longueur du contexte. Le caching se produit automatiquement, ce qui rend les préfixes longs non modifiés particulièrement utiles pour les agents et les grandes bases de code.

Cela place K3 bien au-dessus du niveau de prix de son prédécesseur K2.6, qui coûte officiellement 0,16 $ par million de tokens avec un cache, 0,95 $ sans, et 4,00 $ pour la sortie. Les fournisseurs chinois n'offrent plus leurs modèles de pointe à des prix très bas non plus.

Cependant, K3 est beaucoup moins cher que les meilleurs modèles occidentaux et se situe davantage dans le milieu de gamme supérieur. Le nouveau Sonnet 5 d'Anthropic, par exemple, coûte également 3 $ par million de tokens d'entrée et 15 $ pour la sortie, mais offre des performances inférieures.

K3 utilise également moins de tokens que son prédécesseur. Il a nécessité environ 132 millions de tokens de sortie pour compléter les neuf évaluations, contre environ 166 millions pour K2.6, soit une réduction de 21 % tout en obtenant 13 points de plus. En raison des prix de tokens beaucoup plus élevés, K3 coûtera probablement encore plus par tâche que K2.6 dans la plupart des cas.

K3 est déjà disponible via Kimi.com, l'application mobile pour iOS, Android, et HarmonyOS, le client de bureau Kimi Work (version 3.1.0 et ultérieure), et Kimi Code. Sur OpenRouter, le modèle est répertorié sous l'identifiant "moonshotai/kimi-k3", bien qu'il soit actuellement servi uniquement par Moonshot. Les poids ouverts sont attendus d'ici la fin juillet.

Pour les entreprises, Kimi propose une version distincte avec gestion des membres et la possibilité de séparer les comptes personnels et professionnels. Une plateforme prévue appelée Kimi Hosted Agent fournira des environnements et des temps d'exécution isolés pour des tâches de longue durée. Les utilisateurs intéressés peuvent s'inscrire sur la liste d'attente dès maintenant.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires