Kimi K3 de Moonshot AI : 2,8 trillions de paramètres dévoilés

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Une avancée impressionnante dans la série Kimi
Le dernier modèle de Moonshot AI, le Kimi K3, se distingue par sa taille impressionnante, atteignant 2,8 trillions de paramètres. Ce chiffre représente presque trois fois la taille de son prédécesseur, le Kimi K2. Avec 104 milliards de paramètres activés et une fenêtre de contexte de 1 million de tokens, le Kimi K3 intègre également une vision native. Ces caractéristiques démontrent une efficacité de mise à l'échelle de 2,5 fois supérieure à celle du Kimi K2, soulignant la pertinence continue de la loi de mise à l'échelle. Toutefois, le rapport technique met en avant que comprendre le fonctionnement interne de ces modèles est crucial pour saisir pleinement leur potentiel.
Dans cet article, nous explorerons quatre innovations architecturales qui rendent possible l'échelle du Kimi K3 :
- Les architectures d'attention de base : avec l'attention linéaire Kimi Delta (KDA) et le Gated MLA avec des résidus d'attention NoPE.
- Le Latent MoE avec un équilibrage de charge basé sur les quantiles.
- Une tour de vision qui fonctionne sans pré-entraînement contrastif.
Nous conclurons par une discussion sur la co-conception de l'infrastructure, une tendance amorcée avec le DeepSeek V3.
Architectures d'attention de base
La base de l'attention du Kimi K3 est constituée de trois couches KDA et d'une couche Gated MLA, chacune suivie d'une couche stable LatentMoE.
Kimi Delta Attention (KDA)
Contrairement aux modèles traditionnels qui utilisent l'attention multi-tête, le Kimi K3 adopte le Kimi Delta Attention (KDA) pour trois de ses quatre couches d'attention. Ce mécanisme, introduit dans le Kimi Linear (2025), est dérivé du Gated DeltaNet. La DeltaNet propose une règle delta, basée sur la transformation de Householder généralisée, pour améliorer la performance des modèles d'attention linéaire. Pour optimiser l'efficacité computationnelle, le KDA peut être reformulé en un format parallèle par morceaux, typique du calcul d'attention linéaire. De plus, un mappage negative-softplus est utilisé pour éviter les débordements de précision en limitant les logits de déclin.
Gated MLA & No Position Encoding (NoPE)
Le Multi-head Latent Attention (MLA), introduit par DeepSeek-V2, vise à réduire la taille du cache KV en compressant les clés et valeurs dans un latent partagé de faible rang. Contrairement au MLA classique qui utilise RoPE pour l'encodage positionnel, le Kimi K3 opte pour NoPE (No Position Encoding). Cette approche est justifiée par le fait que les couches KDA fournissent déjà un mélange sensible à la position grâce à leur déclin récurrent, permettant aux couches MLA de se concentrer sur leurs fonctions principales.
Résidus d'attention : Une approche séquentielle de la profondeur
Le rapport technique du Kimi K3 propose un concept novateur : traiter les résidus d'attention de manière similaire aux dépendances séquentielles des transformateurs. Cela implique de calculer le résidu par paire de couches. Avec une profondeur de modèle inférieure à 100, le coût de calcul total reste O(L²d), ce qui est gérable, et peut être optimisé par un calcul par blocs.
Stable LatentMoE : Une échelle sans précédent
Le Kimi K3 pousse l'architecture MoE à de nouveaux sommets avec 896 experts routés et 16 activés par token, comparé aux 384 routés / 8 actifs du Kimi K2. Ce saut de 133% en sparsité nécessite des ajustements architecturaux. Le LatentMoE permet aux experts partagés de fonctionner sur la pleine largeur cachée du modèle, tandis que les experts routés opèrent dans un espace latent plus restreint. Cela réduit le coût du routeur tout en permettant l'activation de 16 experts par token de manière économique.
Une tour de vision sans pré-entraînement contrastif
Un des résultats les plus surprenants du rapport concerne l'encodeur de vision du Kimi K2.5. Contrairement aux autres tours de vision LLM multimodales, celui-ci n'a pas été initialisé par un pré-entraînement contrastif. Cette approche innovante marque une rupture avec les méthodes traditionnelles, ouvrant de nouvelles perspectives pour les futures architectures de vision.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.