Z.ai lance GLM-5.3-Flash : coût divisé, sans GPU Nvidia

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Z.ai commercialise GLM-5.3-Flash, un modèle de 320 milliards de paramètres et 1 million de tokens de contexte, annoncé comme exploitable sur des puces chinoises avec une efficacité comparable aux GPU Nvidia. Les mesures tierces le placent près de GLM-5.3 pour 0,09 dollar par tâche, et un rapport évoque jusqu’à 100 trillions de tokens servis par jour.
Capacité revendiquée et pari d’indépendance vis-à-vis de CUDA
SemiAnalysis rapporte que l’infrastructure associée au modèle a servi 100 trillions de tokens par jour. Le modèle fonctionne entièrement sur des puces d’IA chinoises, et Z.ai affirme une efficacité comparable à celle de GPU Nvidia courants, tant en performance matérielle qu’en coût par token. SemiAnalysis y voit un nouveau test du fossé lié à CUDA après des résultats récents autour de nouvelles puces d’OpenAI. CUDA, couche de programmation de Nvidia entre logiciels d’IA et GPU, est développée depuis près de 20 ans et la plupart des frameworks y sont optimisés, ce qui rend la migration vers d’autres puces coûteuse en réécriture d’opérations, ajustements mémoire et résolution de goulets d’étranglement. Pour contourner ces contraintes, Z.ai a bâti un service basé sur SGLang et segmenté le traitement en étapes indépendantes ; l’équipe indique avoir triplé le débit par rapport à sa première implémentation sur le même matériel, avec l’aide d’un agent issu de GLM-5.3 pour l’optimisation.
Performance mesurée et coût par tâche à 0,09 dollar
Artificial Analysis évalue GLM-5.3-Flash à 57 points sur l’Intelligence Index avec un effort de raisonnement maximal, soit trois points derrière GLM-5.3 à 60, et au niveau de GPT-5.6 Terra et Muse Spark 1.2. Le coût par tâche sur cet index atteint 0,09 dollar, environ 7,5 fois moins que GLM-5.3 ; Artificial Analysis le place sur la frontière de Pareto entre intelligence et coût. Sur GDPval-AA v2, l’Elo d’environ 1770 égale GLM-5.3 et Grok 4.6, derrière Claude Opus 5. Les mesures indiquent en revanche qu’environ 90 % des tokens de sortie sont alloués au raisonnement.
Spécifications : 320 milliards de paramètres, 18 milliards actifs
GLM-5.3-Flash intègre un total de 320 milliards de paramètres ainsi qu’une fenêtre de contexte pouvant atteindre un million de tokens. Selon Z.ai, il s’agit du premier modèle multimodal natif de la série GLM-5, avec 320 milliards de paramètres au total dont 18 milliards activés. Le modèle est diffusé sous licence MIT et ses poids sont disponibles au téléchargement sur Hugging Face.
Tarification API et tests anonymes avant lancement
Sur l’API de Z.ai, les tarifs annoncés sont de 0,15 dollar par million de tokens d’entrée et 0,50 dollar par million de tokens de sortie, pour un niveau un peu supérieur à dix pour cent du prix de GLM-5.3. Avant l’annonce officielle, le modèle a été évalué anonymement sous le nom « ox-alpha » sur OpenCode et OpenRouter, où il est devenu le modèle le plus populaire de la semaine. Z.ai indique que l’ensemble de ce trafic a été traité sur des puces d’IA chinoises.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.