Brief IA : Kimi K3 : la Chine mise sur la mémoire pour l'IA

Kimi K3 : la Chine mise sur la mémoire pour l'IA

Brief IA
Tom Levy·8 min·6 vues

Le modèle Kimi K3 de Moonshot AI, lancé le 16 juillet 2023, atteint 2,8 trillions de paramètres, établissant un nouveau record pour un modèle à poids ouvert. En privilégiant la mémoire sur le calcul, il nécessite 1,4 To de mémoire et illustre comment la Chine cherche à contourner les restrictions américaines en matière d'IA.

En bref
1Le modèle Kimi K3 de Moonshot AI, lancé le 16 juillet, atteint 2,8 trillions de paramètres, un record pour un modèle à poids ouvert.
2Moonshot AI privilégie la mémoire sur le calcul, utilisant des techniques comme la mixture-of-experts pour réduire les besoins en calcul.
3Le K3 nécessite 1,4 To de mémoire, et son déploiement exige des infrastructures de grande envergure, souvent louées.
💡Pourquoi c'est importantLe Kimi K3 illustre comment la Chine contourne les restrictions américaines en misant sur la mémoire, un domaine où elle cherche à rattraper son retard.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Kimi K3 : un modèle IA qui mise sur la mémoire

Le modèle Kimi K3 de Moonshot AI, dévoilé le 16 juillet, a attiré l'attention grâce à son impressionnant nombre de paramètres : 2,8 trillions. Ce chiffre place le K3 en tête des modèles à poids ouvert, une catégorie où aucun autre modèle n'avait atteint un tel niveau auparavant. Dans le secteur de l'intelligence artificielle, les modèles sont souvent classés par taille, et le K3 se situe dans la catégorie dite "3T", un seuil inédit pour les modèles accessibles au public.

Ce modèle phare de Moonshot AI a fait un bond spectaculaire, passant de 1 trillion à 2,8 trillions de paramètres en une seule publication. Ce saut dépasse largement le précédent record de 1,6 trillion détenu par le DeepSeek V4 Pro. Bien que le nombre de paramètres soit souvent mis en avant, il ne raconte qu'une partie de l'histoire du fonctionnement du K3.

Une stratégie de contournement des restrictions américaines

L'augmentation du nombre de paramètres du K3 pourrait être interprétée comme une réponse aux restrictions américaines sur les capacités de calcul. Cependant, le blog technique de Moonshot AI suggère une approche différente : le K3 ne contourne pas les contraintes de calcul, mais les déplace en échangeant le calcul contre la mémoire à presque tous les niveaux de sa conception.

Cette stratégie mérite d'être examinée de près, car le calcul et la mémoire ne sont pas des contraintes interchangeables, et leur accessibilité varie pour un laboratoire chinois.

Le défi de la mémoire dans le modèle Kimi K3

Deux facteurs principaux déterminent le coût d'exécution d'un modèle d'IA de grande taille : la quantité de calcul nécessaire pour générer chaque mot, et la quantité de modèle qui doit être prête et accessible en permanence. Le premier facteur est le calcul, tandis que le second est la mémoire. Les restrictions sur l'exportation de puces ont initialement frappé durement la Chine, et la conception du K3 semble être une tentative de réduire l'utilisation du calcul.

Le changement principal introduit par Moonshot AI est une technique appelée "mixture-of-experts". Au lieu d'utiliser l'ensemble du modèle pour chaque mot, le K3 est divisé en 896 sections spécialisées, n'en utilisant que 16 à la fois, soit environ 1,8 % du total. Cela réduit considérablement le calcul par mot. Cependant, la mémoire reste inchangée, car les 2,8 trillions de paramètres doivent être chargés et prêts à être utilisés à tout moment.

Pour réduire la facture de mémoire, Moonshot AI a formé le K3 à fonctionner avec une précision de quatre bits par paramètre, au lieu des seize habituels. Cette méthode, connue sous le nom de "formation consciente de quantification", a été appliquée dès la phase de réglage fin. Moonshot AI affirme que ce choix a été fait pour "une large compatibilité matérielle", ce qui semble être une stratégie pour éviter l'utilisation de silicium non-Nvidia. Les économies sont significatives : une analyse indépendante estime que le modèle nécessite environ 1,4 To dans ce format, contre 5,6 To à pleine précision.

Kimi Delta Attention : une innovation pour réduire les coûts de mémoire

Un autre changement, appelé "Kimi Delta Attention", vise à réduire un autre coût de mémoire. Lorsqu'un modèle traite un document très long, il accumule un stock de tout ce qu'il a déjà lu. À la limite annoncée de K3 d'un million de tokens, soit quelques milliers de pages, ce stock devient plus important que le modèle lui-même en mémoire.

Moonshot AI est particulièrement clair sur l'importance commerciale de cette approche. L'entreprise a contribué à un code de mise en cache pour le projet de service open-source vLLM, affirmant que cette combinaison permet de tarifer le K3 de manière compétitive malgré sa taille. Moonshot recommande d'exécuter le K3 sur 64 ou plus d'accélérateurs, reliés de manière suffisamment étroite pour fonctionner comme un seul pool.

Cette approche est similaire à celle des systèmes CloudMatrix de Huawei, indiquant que le véritable contournement réside dans la capacité à rassembler la mémoire sur de nombreuses puces individuelles. Le calcul de niveau formation ne peut pas être assemblé de la même manière.

Le matériel derrière le Kimi K3

Le blog de Moonshot AI ne précise pas si ce regroupement se fait sur du silicium chinois. Les tests au niveau des puces ont été réalisés sur des Nvidia H200S et sur un "GPGPU d'un fournisseur alternatif", que l'entreprise ne nomme pas. D'autres résultats ont été évalués sur une Nvidia L20, la carte réduite vendue en Chine sous les règles d'exportation.

Le blog ne précise pas où se trouve le matériel H200, et la Chambre des représentants des États-Unis a adopté en janvier une loi pour fermer la faille de location de cloud offshore qui avait permis aux entreprises chinoises d'accéder à des accélérateurs restreints à distance. La mémoire, et non la puissance de traitement, est l'endroit où l'industrie des puces chinoises est la plus en retard.

Lors des négociations commerciales en août 2025, Pékin a demandé un allègement des restrictions sur la mémoire à large bande plutôt que sur les outils de lithographie ou l'accès à TSMC, un signal clair de ce que les responsables considèrent comme réellement contraignant. La production nationale de cette mémoire est projetée à environ deux millions de piles cette année, suffisante pour environ 250 000 à 300 000 puces de classe Huawei Ascend 910C, tandis que SMIC a une capacité de wafer pour plus d'un million.

Déploiement du modèle Kimi K3 : défis et opportunités

Pour les entreprises de la région, la question pratique n'est pas de savoir si le K3 domine un classement, mais si un modèle à poids ouvert de cette taille est déployable. Les entreprises asiatiques se tournent vers les poids ouverts pour trois raisons : prix, souveraineté des données et couverture des langues régionales. Les banques et assureurs de toute l'Asie du Sud-Est ont testé des modèles ouverts auto-hébergés pour que les enregistrements ne quittent jamais leurs propres systèmes.

Les poids seront disponibles le 27 juillet, et toute organisation capable de se permettre le matériel pourra télécharger, modifier et exécuter le K3 dans ses propres murs. La question est de savoir combien peuvent le faire. Moonshot recommande de servir le modèle sur 64 ou plus d'accélérateurs reliés comme un seul pool, et les poids seuls représentent environ 1,4 To dans le format dans lequel il est expédié, selon une analyse indépendante, avant la mémoire nécessaire pour traiter un long document.

C'est un engagement de centre de données, pas de salle de serveur. Pour la plupart des entreprises, le résultat pratique est de louer une capacité dédiée plutôt que de la posséder. Cela maintient néanmoins les données dans le pays et sous contrat, ce que la plupart des régulateurs régionaux demandent. Ce que cela ne livre pas, c'est l'indépendance vis-à-vis des fournisseurs d'infrastructure qui a attiré de nombreux acheteurs vers les poids ouverts en premier lieu.

Les défis techniques et financiers du Kimi K3

Le logiciel n'est pas prêt non plus. Les deux principaux changements architecturaux du K3 sont suffisamment récents pour que les outils open-source standard pour exécuter des modèles ne les prennent pas encore en charge, et Moonshot dit qu'il travaille avec des partenaires d'inférence et des mainteneurs open-source pour aligner les détails techniques avant la publication. Les équipes prévoyant un déploiement auto-hébergé devraient considérer la date de lancement et la date d'utilisation comme des choses différentes.

Le prix du K3 a également évolué. Il est lancé avec un effort de raisonnement maximal comme seule option, avec des modes inférieurs à suivre, de sorte que les chaînes de raisonnement longues et les étapes réessayées s'additionnent rapidement.

Performances et limitations du modèle Kimi K3

Arena a placé le K3 en première position dans son évaluation de code frontend avec 1 679 points, devant Fable 5, lors de tests aveugles de développeurs, comme rapporté par Tom's Hardware. Ce résultat est réel. C'est aussi une référence dans un domaine.

Moonshot lui-même est plus mesuré que ses titres. L'entreprise déclare que la performance globale du K3 est encore inférieure à celle de Claude Fable 5 et GPT 5.6 Sol, et énumère trois limitations : la qualité de génération peut devenir très instable si un harnais ne parvient pas à renvoyer le contenu de réflexion historique, le modèle peut prendre des décisions inattendues au nom d'un utilisateur lorsque l'intention est ambiguë, et il montre un écart d'expérience utilisateur notable par rapport à Fable 5 et GPT 5.6 Sol.

Ses propres notes de bas de page révèlent également que Fable 5 a rencontré des solutions de secours sur 35 % des tâches dans l'évaluation SWE Marathon de Moonshot, ce qui a pu affecter le score mesuré de ce modèle. Tout le reste reste une revendication de première partie. Aucun chiffre du K3 ne peut être vérifié de manière indépendante tant que les poids ne sont pas publics.

Les analystes de Bank of America, dirigés par Alex Liu, ont déclaré dans une note que le K3 montre que la pré-formation à grande échelle combinée à un travail architectural peut encore offrir des gains significatifs pour les modèles phares chinois malgré les contraintes de calcul, ce qui est la version sobre de l'argument, et plus proche de ce que soutient le blog.

La direction de l'évolution n'est pas en dispute. Le 27 juillet est le moment où nous découvrirons combien de K3 appartient à cette colonne.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires