Alibaba et DeepSeek : IA chinoise à coûts réduits

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Alibaba et DeepSeek : des modèles d'IA plus accessibles en Chine
Alibaba a récemment dévoilé Qwen3.8-Max, son modèle d'intelligence artificielle le plus avancé à ce jour. Ce modèle se distingue par sa taille impressionnante de 2,4 trillions de paramètres. Grâce à une architecture de mélange d'experts, il n'active qu'une fraction de ses paramètres pour chaque requête, ce qui permet de réduire significativement les coûts et les délais de réponse. En moyenne, 95 milliards de paramètres sont actifs simultanément, optimisant ainsi l'efficacité sans nécessiter l'activation complète du modèle.
De son côté, DeepSeek a également adopté une architecture similaire mais à une échelle plus modeste. Le modèle V4-Flash est répertorié par Artificial Analysis avec 284 milliards de paramètres, dont 13 milliards sont actifs lors de l'inférence. En comparaison, le modèle Kimi K3 de Moonshot AI, lancé en juillet, possède 2,8 trillions de paramètres avec environ 104 milliards actifs.
Compétition sur les fonctionnalités et les coûts
Le modèle Qwen3.8-Max d'Alibaba est capable de traiter du texte, des images et des vidéos, tout en supportant jusqu'à un million de tokens de contexte. Alibaba a également affirmé que ce modèle a réussi à compléter un projet d'ingénierie logicielle en seulement 16 jours. En termes de coût, Qwen3.8-Max est proposé à 2 $ par million de tokens d'entrée et 6 $ par million de tokens de sortie, ce qui est compétitif par rapport aux 3 $ et 15 $ respectivement pour le modèle Kimi K3.
La taille d'un modèle n'est pas le seul facteur influençant le coût d'inférence. D'autres éléments tels que l'architecture, le nombre de paramètres actifs, la consommation de tokens et le nombre d'appels nécessaires pour accomplir une tâche jouent également un rôle crucial dans le coût total d'exécution d'un modèle.
Classements et performances des modèles
Après son lancement, Qwen3.8-Max a rapidement pris la tête des modèles de texte chinois sur la plateforme de comparaison Arena.AI. Cependant, il est resté derrière plusieurs modèles d'Anthropic dans le classement général. En ce qui concerne l'analyse d'images et d'autres matériaux visuels, il s'est classé deuxième, juste derrière une version d'Anthropic Claude Fable 5.
DeepSeek : une stratégie de prix agressive
DeepSeek a choisi une approche différente avec son modèle V4-Flash, en se concentrant sur des tarifs d'inférence plus bas que ceux de nombreux systèmes d'IA concurrents. Selon Artificial Analysis, V4-Flash est proposé à 0,14 $ par million de tokens d'entrée et 0,28 $ par million de tokens de sortie. Le modèle dispose d'une fenêtre de contexte d'un million de tokens et 284 milliards de paramètres, dont 13 milliards sont actifs lors de l'inférence.
Un tarif de cache de 0,003 $ par million de tokens est proposé pour la version Max Effort de V4-Flash, soit une réduction de 98 % par rapport au tarif d'entrée standard. Ces tarifs plus bas se reflètent dans les tests de référence d'Artificial Analysis, qui ont estimé le coût moyen de V4-Flash à trois cents par test, comparé à 86 cents pour Kimi K3, 1,86 $ pour le GPT-5.6 Sol d'OpenAI, et 3,15 $ pour Claude Fable 5 d'Anthropic.
L'impact des coûts sur les performances
Le modèle Kimi K3 de Moonshot AI illustre comment les prix API annoncés peuvent différer du coût réel d'exécution de tâches plus longues. Artificial Analysis répertorie ce modèle à 3 $ par million de tokens d'entrée et 15 $ par million de tokens de sortie, avec des entrées mises en cache à 0,30 $ par million de tokens. Sur le benchmark AA-Briefcase pour le travail de connaissance agentique, Kimi K3 a coûté en moyenne 10,57 $ par tâche, générant environ 120 000 tokens de sortie et utilisant en moyenne 83 tours par tâche.
Le coût reflète la tarification des tokens de Kimi K3, le volume de sortie et le nombre d'interactions avec le modèle. Des appels répétés et des sorties plus importantes peuvent donc augmenter le coût total au-delà de ce que le tarif API principal suggère.
L'option des poids ouverts
Le coût d'utilisation des modèles est également influencé par la manière dont ils sont distribués. Alibaba, DeepSeek et Moonshot AI continuent de soutenir les versions à poids ouverts parallèlement à l'accès API hébergé, offrant ainsi aux développeurs plus de flexibilité pour le déploiement.
Artificial Analysis répertorie DeepSeek V4-Flash comme un modèle à poids ouverts sous une licence MIT, avec des poids disponibles via Hugging Face. Kimi K3 est également disponible en tant que modèle à poids ouverts sous la propre licence de Moonshot AI.
Les poids ouverts permettent aux développeurs d'exécuter des modèles sur leur propre infrastructure ou via des fournisseurs tiers, au lieu de dépendre uniquement d'un service d'inférence hébergé par le développeur. Les coûts de déploiement dépendent du matériel et de l'infrastructure utilisés, mais l'accès au modèle n'est pas lié à une seule API hébergée.
Cette approche diffère des principaux modèles proposés par OpenAI, Anthropic et Google, qui gardent généralement leurs poids de modèle fermés.
Lian Jye Su, analyste en chef chez Omdia, souligne que le choix du modèle pour de nombreuses charges de travail commerciales ne dépend pas uniquement de l'accès au système le plus performant. Selon Su, « de nombreux flux de travail commerciaux n'ont pas besoin du meilleur modèle de l'industrie. Ils ont besoin de modèles qui sont suffisamment bons, abordables, transparents et accessibles, et les modèles à poids ouverts aident à répondre à cette demande. »
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.