Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
DeepSeek présente V4.1 Flash, un modèle de 763 milliards de paramètres conçu pour baisser les coûts et la latence. L’architecture mise sur des poids N-grammes déportables et des caches KV allégés. Google et Alibaba explorent des voies proches, signe d’un mouvement plus large vers des LLM moins gourmands.
N-grammes en vogue et promesse d’allègement des infrastructures
Google applique déjà une technique voisine, le Per-Layer Embedding (PLE), à ses modèles Gemma pour déplacer une partie des poids vers un stockage local, principalement sur des modèles de petite taille. Fin août, Alibaba a dévoilé Qwen 3.8-Flash-Next, un modèle de 180 milliards de paramètres dont 51 milliards sont des N-grammes, en s’inspirant de recherches publiées par DeepSeek en janvier. Alibaba indique que cette architecture servira de base à sa prochaine génération Qwen 4. Ces avancées laissent envisager que les N-grammes pourraient s’imposer régulièrement dans la conception des grands modèles de langage, dans le but de réduire la surcharge et la prolifération des serveurs, onéreux à fabriquer et à maintenir. En environnement de production, la mémoire requise reste néanmoins importante en raison des caches KV, dont la capacité varie selon la longueur du contexte et le nombre d’utilisateurs connectés en simultané.
Mécanisme N-grammes : tables consultées et poids déportables
Dans V4.1, 196 milliards des 763 milliards de paramètres sont des N-grammes, constituant un module de mémoire conditionnelle destiné à séparer mémoire et calcul. Ces groupes de tokens servent de connaissances implicites et complètent la prédiction en apportant des informations via des recherches peu coûteuses. Ils fonctionnent comme de grandes tables de consultation et n’ont pas à être chargés intégralement en GPU à chaque génération de token : quelques dizaines de requêtes suffisent. Cette caractéristique permet leur stockage en mémoire système ou sur un support rapide. Théoriquement, les poids en FP8 nécessitent 763 Go de mémoire GPU, mais le déport des N-grammes réduit ce besoin à environ 567 Go.
Caches KV revus : 13 % à 25 % de l’empreinte précédente
DeepSeek a repensé la manière de gérer les caches clé-valeur, qui représentent un poste de consommation mémoire important pour des applications telles que les agents conversationnels. L’utilisation de ces caches représente désormais entre 13 % et 25 % de la quantité consommée par le V4 Flash, une baisse obtenue grâce à des modifications dans les systèmes d’attention et à l’ajout d’un nouveau module encodeur-décodeur causal. Pour une empreinte KV identique, le modèle est capable de prendre en charge un nombre d’utilisateurs quatre à huit fois supérieur. Cette amélioration explique que les exigences mémoire ne croissent pas proportionnellement à la taille du modèle.
Un modèle surdimensionné dans la lignée V3 et R1
Doté de 763 milliards de paramètres, V4.1 Flash affiche une taille supérieure de plus de 2,5 fois à celle du modèle précédent et dépasse les modèles V3 et R1, qui avaient marqué l’émergence de DeepSeek début 2025. Présenté un jeudi, V4.1 est positionné par DeepSeek comme une mise à jour orientée réduction des coûts et de la latence. Malgré son numéro de version, l’entreprise met en avant des changements architecturaux importants et présente cette évolution comme une étape vers des modèles plus performants à ressources contenues.





