Brief IA : Alibaba lance Qwen3.8-Max, IA de 2,4 trillions de paramètres

Alibaba lance Qwen3.8-Max, IA de 2,4 trillions de paramètres

Brief IA
Tom Levy·8 min·2 vues

Alibaba a lancé Qwen3.8-Max, un modèle IA de 2,4 trillions de paramètres, capable d'exécuter des tâches complexes de manière autonome sur plusieurs jours. Ce modèle est conçu pour des applications variées, allant de la reproduction d'articles de recherche à la conception de puces électroniques. Les poids du modèle seront publiés la semaine prochaine, ce qui pourrait ouvrir la voie à de nouvelles innovations dans le secteur technologique.

En bref
1Alibaba dévoile Qwen3.8-Max, un modèle IA doté de 2,4 trillions de paramètres, capable de gérer des tâches complexes sur plusieurs jours.
2Le modèle est conçu pour des applications variées, de la reproduction d'articles de recherche à la conception de puces électroniques.
3Les poids du modèle Qwen3.8-Max seront publiés la semaine prochaine, ouvrant la voie à de nouvelles innovations.
💡Pourquoi c'est importantCe modèle pourrait transformer les capacités de l'IA en automatisant des tâches complexes sur de longues durées, impactant divers secteurs technologiques.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Alibaba lance Qwen3.8-Max, IA de 2,4 trillions de paramètres

Alibaba a dévoilé Qwen3.8-Max, un modèle de langage de 2,4 trillions de paramètres conçu pour accomplir des tâches complexes de manière autonome sur plusieurs jours.

Lors des tests, le modèle a construit des logiciels de manière autonome, reproduit et amélioré les résultats d'un article de recherche, et a réussi à gérer une entreprise de commerce électronique simulée. Les benchmarks internes placent ses performances au même niveau que les meilleurs modèles occidentaux. Qwen3.8-Max est disponible dès maintenant, avec les poids qui seront publiés la semaine prochaine.

Le nouveau modèle phare d'Alibaba, Qwen3.8-Max, est conçu pour gérer des tâches complexes de manière autonome sur plusieurs jours, allant de la reproduction d'articles de recherche à la conception de puces. L'équipe prévoit de publier les poids la semaine prochaine.

L'équipe Qwen d'Alibaba a présenté Qwen3.8-Max, son modèle de langage le plus performant à ce jour. Le modèle s'étend à 2,4 trillions de paramètres au total, avec 95 milliards actifs par requête. Qwen3.8-Max s'appuie sur l'architecture Qwen3.5, et l'équipe indique que l'accent est mis sur l'accomplissement de tâches complexes de manière indépendante sur des périodes prolongées, plutôt que sur la simple réponse à des requêtes ponctuelles.

Alibaba a d'abord annoncé le modèle à la mi-juillet sous forme de version préliminaire disponible via le plan Token d'Alibaba, Qoder et QoderWork à dix pour cent du prix standard. À ce moment-là, l'équipe avait déjà cité 2,4 trillions de paramètres et classé le modèle juste derrière Fable 5, mais n'avait pas partagé de benchmarks. Qwen3.8-Max est le premier modèle de la classe Qwen-Max dont les poids seront rendus publics.

Trois exécutions de codage autonomes mettent le modèle à l'épreuve

Pour démontrer les capacités de codage de Qwen3.8-Max, l'équipe a présenté trois études de cas dans lesquelles le modèle a travaillé sans aucune aide humaine.

  • Dans le premier cas, Qwen3.8-Max a passé 16 jours à construire l'outil en ligne de commande oh-my-cli. Le modèle a pris des demandes d'utilisateurs, les a transformées en problèmes GitHub, s'est auto-attribué ces tâches, a écrit le code, a effectué des tests et a amélioré les résultats de manière itérative. D'ici le 30 juillet 2026, il avait accumulé 265 commits, 127 pull requests, et 151 problèmes, le tout sans intervention humaine.

  • Dans le deuxième cas, le modèle a reçu l'article de recherche "Unified Data Selection for LLM Reasoning" sans code de départ. Sa tâche était de reproduire les résultats de l'article et de les améliorer. Sur une période d'environ cinq jours et environ 125 heures de temps de calcul, Qwen3.8-Max a écrit 7 600 lignes de code et a exécuté 33 travaux d'entraînement GPU, selon l'équipe. Il a d'abord reproduit les six principaux résultats de l'article. Ensuite, il a testé 18 de ses propres idées sur quatre cycles et a surpassé la méthode de l'article sur le benchmark mathématique AIME24 de 2,7 points.

  • Le troisième cas concernait le défi de reconnaissance d'intention de dialogue multimodal WWW2025 sur la plateforme Tianchi d'Alibaba, où 526 équipes humaines ont concouru. En 24 heures, le modèle a affiné plusieurs modèles de langue chinoise ainsi que Qwen2.5-VL-7B pour des captures d'écran de produits et les a combinés dans un système de vote. Sur 45 soumissions, la précision est passée de 0,60 à 0,853. Cela a placé Qwen3.8-Max devant 458 des 526 équipes humaines.

Conception de puces et test fiscal simulé pour la planification à long terme

Deux autres études de cas ciblent des tâches qui s'étendent sur des centaines de cycles d'interaction. Dans le premier, Qwen3.8-Max devait concevoir un élément de construction cryptographique pour des schémas de chiffrement. La principale métrique d'efficacité pour un tel circuit est le nombre de portes logiques nécessaires, les éléments de base d'une puce. Moins il y a de portes, plus la puce est petite et efficace. Le modèle a commencé avec un design fonctionnel mais encombré utilisant 8 298 portes et l'a réduit à 678 portes après environ 500 itérations.

Après un passage de mise en page automatisé avec l'outil open-source OpenROAD, la surface physique de la puce a diminué de 106x106 à 46x46 micromètres, soit une réduction de 81 %. L'équipe Qwen affirme que le modèle a continué à apporter des changements structurels profonds même après des centaines d'itérations, au lieu de se contenter de modifications superficielles.

La deuxième étude de cas est E-Commerce-Bench, une simulation d'une année fiscale complète dans le commerce en ligne basée sur des données anonymisées de Taobao et Tmall. Le modèle commence avec 100 000 yuan de capital et doit gérer plusieurs magasins en ligne en parallèle pendant une année complète. Cela signifie acheter des produits, négocier avec des fournisseurs en langage naturel, ajuster les prix, gérer les retours et faire face à des crises comme des typhons ou des perturbations de la chaîne d'approvisionnement.

Cachés dans le pool de fournisseurs se trouvent 152 escrocs que le modèle doit repérer. Qwen3.8-Max a terminé avec un solde de 416 252 yuan, quadruplant son capital initial. C'est 38 % de plus que le deuxième, GLM 5.2, et plus de 2,5 fois ce que son prédécesseur Qwen3.7-Max a réussi. Le modèle a investi de manière agressive en début d'année et a réalisé un bénéfice net de plus de 100 000 yuan pendant la saison des fêtes.

Compétences multimodales et reconstruction d'applications sans code source

Pour les tâches multimodales, Qwen3.8-Max peut traiter des documents de plus de 200 pages et des vidéos de plus de 100 heures, selon l'équipe. Ils introduisent également RecreationBench, un nouveau benchmark qui exige que le modèle reconstruise des applications fonctionnelles sans accès au code source.

Le modèle ne peut observer l'application cible que par l'interaction, c'est-à-dire les clics et les entrées au clavier. Les tests couvrent Ubuntu, macOS, Windows, Android et le web. Parallèlement, l'équipe publie Qwen-MM-Plugins, une bibliothèque d'extensions qui ajoute le traitement d'images et de vidéos, l'utilisation d'outils visuels et la mémoire multimodale aux systèmes d'agents existants.

Résultats de benchmark et concurrence en Chine

Les résultats de benchmark d'Alibaba pour Qwen3.8-Max dans les domaines du codage, du travail agentique, du raisonnement et des tâches multimodales le comparent à d'autres modèles de pointe. Dans les tableaux de benchmarks publiés par l'équipe Qwen, le modèle se classe près ou au-dessus de Claude Opus 4.8, Claude Fable 5 et GPT-5.6 Sol dans de nombreuses catégories. Sur PaperBench, Qwen3.8-Max atteint 93, le score le plus élevé de la comparaison. Sur TerminalBench 2.1, il obtient 86,6, derrière les 88,8 de GPT-5.6 Sol. Comme c'est typique avec les chiffres auto-déclarés des fabricants de modèles, ces résultats proviennent d'exécutions internes. La vérification indépendante est encore en attente.

L'équipe Qwen attribue la capacité du modèle à soutenir de telles tâches de longue durée à une expansion majeure des environnements d'entraînement pendant l'apprentissage par renforcement. L'entraînement ne s'est plus concentré uniquement sur des tâches uniques, mais a également couvert des flux de travail sur plusieurs jours, des structures de répertoires imbriqués au lieu de fichiers individuels, et une variété de harnais d'agents.

L'indice de score interne de l'équipe sur plus de dix benchmarks est passé de 0,474 à 0,725. Le modèle a obtenu les meilleurs résultats avec environ 4 000 environnements, après quoi les scores ont légèrement diminué.

À mesure que le nombre d'environnements d'entraînement RL et le temps de calcul augmentent, les scores de Qwen3.8-Max augmentent régulièrement à travers des dizaines de benchmarks internes et publics, selon l'équipe Qwen.

La course aux modèles ouverts en Chine s'intensifie

Le rival le plus direct de Qwen3.8-Max vient également de Chine. Moonshot AI a publié Kimi K3 avec des poids ouverts sur Hugging Face le 27 juillet, un modèle multimodal mélangeant des experts avec 2,8 trillions de paramètres et une fenêtre de contexte d'un million de tokens. En plus des poids, Moonshot a également publié des parties de sa propre infrastructure, y compris des noyaux d'attention, une bibliothèque de communication MoE et des outils pour exécuter des agents à grande échelle. Cependant, des tests indépendants ont tempéré les affirmations de l'entreprise. K3 a été bien en deçà des meilleurs modèles occidentaux tant en capacités cybernétiques qu'en mathématiques complexes.

Qwen3.8-Max est disponible dès maintenant via QwenCloud. Les poids seront mis en ligne sur Hugging Face et ModelScope la semaine prochaine. Le modèle prend en charge à la fois le format de complétions de chat d'OpenAI et le protocole API d'Anthropic, ce qui lui permet de se connecter directement à Claude Code, Codex, Qoder CLI, Qwen Code et OpenClaw. Un paramètre appelé reasoning_effort permet aux utilisateurs de choisir entre trois niveaux qui échangent vitesse contre exhaustivité.

Qwen indique que le modèle fonctionne de manière similaire à travers différents harnais d'agents et n'est pas spécifiquement ajusté pour son propre environnement.

Qwen3.8-Max n'est pas la seule nouveauté qu'Alibaba a ajoutée récemment. Il y a quelques semaines, l'équipe a introduit Qwen-Image-3.0, un générateur d'images pour des mises en page denses en informations qui gère des entrées allant jusqu'à 4 500 tokens et rend du texte lisible aussi petit que dix pixels. À l'autre extrémité du spectre, Alibaba continue de promouvoir de petits modèles ouverts comme Qwen3.6-35B-A3B, qui possède 35 milliards de paramètres au total mais n'active que trois milliards à la fois.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires