Tu veux les meilleurs outils IA avant les autres ?
On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Le laboratoire d'intelligence artificielle chinois DeepSeek a récemment dévoilé ses nouveaux modèles de la série V4, marquant une avancée significative dans le domaine des modèles de langage à grande échelle. Les deux modèles, DeepSeek-V4-Pro et DeepSeek-V4-Flash, sont des prévisualisations qui se distinguent par leur taille et leur coût attractif.
Le dernier modèle du laboratoire, DeepSeek V3.2, ainsi que sa version spéciale, avait été publié en décembre dernier. Aujourd'hui, DeepSeek lance les premiers modèles de la très attendue série V4. Ces modèles, DeepSeek-V4-Pro et DeepSeek-V4-Flash, sont conçus comme des Mixtures of Experts avec un contexte impressionnant de 1 million de tokens. Le modèle Pro, avec ses 1,6 trillion de paramètres, dont 49 milliards sont actifs, se positionne comme le plus grand modèle à poids ouverts actuellement disponible, surpassant des concurrents tels que Kimi K2.6 (1,1T) et GLM-5.1 (754B), et plus de deux fois la taille de DeepSeek V3.2 (685B). Le modèle Flash, quant à lui, dispose de 284 milliards de paramètres, avec 13 milliards actifs. Ces modèles utilisent la licence standard MIT.
En termes de stockage, le modèle Pro nécessite 865 Go sur la plateforme Hugging Face, tandis que le modèle Flash en demande 160 Go. L'auteur espère qu'un modèle Flash légèrement quantifié pourrait fonctionner sur un MacBook Pro M5 de 128 Go. Il est envisagé que le modèle Pro puisse fonctionner en streamant uniquement les experts actifs nécessaires depuis le disque.
Pour tester ces modèles, l'auteur a utilisé OpenRouter, en installant le module llm-openrouter. Voici un exemple de commande utilisée pour générer un SVG d'un pélican faisant du vélo :
llm install llm-openrouter
llm openrouter refresh
llm -m openrouter/deepseek/deepseek-v4-pro 'Générer un SVG d'un pélican faisant du vélo'
Les résultats pour DeepSeek-V4-Flash et DeepSeek-V4-Pro ont été comparés avec ceux obtenus précédemment avec DeepSeek V3.2 en décembre, V3.1 en août, et V3-0324 en mars 2025. Bien que les pélicans générés soient de bonne qualité, l'aspect le plus remarquable de ces nouveaux modèles est leur coût.
DeepSeek propose des tarifs extrêmement compétitifs : 0,14 $/million de tokens en entrée et 0,28 $/million de tokens en sortie pour le modèle Flash, et 1,74 $/million en entrée et 3,48 $/million en sortie pour le modèle Pro. Ces prix défient ceux des modèles de pointe de Gemini, OpenAI et Anthropic. Par exemple, DeepSeek-V4-Flash est le moins cher des petits modèles, battant même le GPT-5.4 Nano d'OpenAI, tandis que DeepSeek-V4-Pro est le moins cher des grands modèles de pointe.
Une note du document de DeepSeek explique pourquoi ils peuvent proposer ces modèles à un prix si bas : ils se sont concentrés sur l'efficacité avec cette version, en particulier pour les prompts de contexte plus longs. Dans le scénario d'un contexte de 1 million de tokens, même DeepSeek-V4-Pro, qui a un plus grand nombre de paramètres activés, n'atteint que 27 % des FLOPs à un seul token (mesurés en FLOPs FP8 équivalents) et 10 % de la taille du cache KV par rapport à DeepSeek-V3.2. De plus, DeepSeek-V4-Flash, avec son plus petit nombre de paramètres activés, pousse l'efficacité encore plus loin : dans le cadre d'un contexte de 1 million de tokens, il n'atteint que 10 % des FLOPs à un seul token et 7 % de la taille du cache KV par rapport à DeepSeek-V3.2.
Les benchmarks auto-rapportés de DeepSeek dans leur document montrent que leur modèle Pro est compétitif avec ces autres modèles de pointe, bien qu'avec cette note : à travers l'expansion des tokens de raisonnement, DeepSeek-V4-Pro-Max démontre des performances supérieures par rapport à GPT-5.2 et Gemini-3.0-Pro sur des benchmarks de raisonnement standard. Néanmoins, ses performances sont légèrement inférieures à celles de GPT-5.4 et Gemini-3.1-Pro, suggérant une trajectoire de développement qui accuse un retard d'environ 3 à 6 mois par rapport aux modèles de pointe.
L'attention se tourne désormais vers les futures versions quantifiées par l'équipe Unsloth, qui pourraient encore améliorer l'accessibilité et l'efficacité de ces modèles sur des machines personnelles. L'auteur garde un œil sur huggingface.co/unsloth/models, s'attendant à ce que l'équipe Unsloth ait bientôt une série de versions quantifiées. Il sera très intéressant de voir comment ce modèle Flash fonctionne sur sa propre machine.



