Google DeepMind réduit les coûts avec DiffusionGemma

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Google DeepMind réduit les coûts avec DiffusionGemma
Google a prouvé qu'il n'est pas nécessaire de former un modèle de diffusion de texte depuis le début en adaptant Gemma 4 en un modèle de diffusion. Le rapport technique récemment publié explique son fonctionnement et les compromis impliqués.
Google DeepMind a lancé DiffusionGemma en tant que modèle à la mi-juin et a maintenant publié un rapport technique. Contrairement aux modèles de langage standard qui génèrent du texte un jeton à la fois, DiffusionGemma affine des blocs de 256 jetons en parallèle, de manière similaire à la façon dont les IA d'images extraient une image du bruit. Sur un accélérateur Nvidia H100, le modèle atteint environ 1 500 jetons par seconde.
La création d'un nouveau modèle depuis le début n'était pas nécessaire. L'équipe a commencé avec le modèle existant Gemma-4-26B-A4B et l'a converti en un modèle de diffusion en utilisant moins de dix pour cent du budget de jetons d'entraînement initial, selon le rapport.
DiffusionGemma offre plusieurs fois la vitesse de sortie des modèles Gemma 4 et des modèles de diffusion précédents tout en maintenant une précision comparable.
Deux étapes d'entraînement équilibrent qualité et vitesse
Dans la première des deux étapes, le modèle apprend à reconstruire des blocs de texte bruités à partir de données d'exemple. Une phase combinée d'apprentissage par renforcement et de distillation de l'échantillonneur suit, que Google appelle SD·RL. L'apprentissage par renforcement améliore généralement la qualité des réponses, tandis que la distillation de l'échantillonneur permet au modèle de fonctionner avec moins d'étapes de calcul. Google fusionne les deux en un seul processus.
Selon le rapport, cette approche combinée augmente la qualité sur les benchmarks de raisonnement de dix points en moyenne tout en quadruplant presque le nombre de jetons par étape de calcul. En conséquence, les réponses de DiffusionGemma sont environ 50 % plus courtes, ce qui augmente encore la vitesse.
Raisonnement bidirectionnel permettant au modèle de se corriger
Les modèles de langage standard doivent s'engager sur le premier chiffre d'une réponse avant d'avoir terminé le raisonnement. Dans un problème mathématique du rapport, Gemma 4 commence sa réponse avec "-1", réalise pendant son raisonnement que "-25" est correct, et ajoute une correction par la suite. DiffusionGemma développe la réponse et le raisonnement en parallèle, ce qui lui permet de corriger les erreurs avant que la sortie ne soit finalisée.
DiffusionGemma peut corriger une mauvaise réponse initiale lors des étapes de débruitage ultérieures, contrairement à un modèle autorégressif.
La résolution de Sudoku fonctionne sur le même principe, car chaque entrée dépend des entrées qui viennent plus tard. Après un ajustement minimal, DiffusionGemma résout près de 85 % des puzzles correctement, tandis que le modèle de base échoue complètement à cette tâche. Les sorties structurées comme JSON ou les réparations de code se terminent après seulement deux à trois étapes de raffinement, car l'entrée détermine déjà la plupart des jetons.
DiffusionGemma conserve également sa capacité originale à générer du texte mot par mot, permettant aux utilisateurs de basculer entre les deux modes en fonction de la tâche.
Les lacunes de raisonnement et les limites multi-utilisateurs persistent
La performance absolue est inférieure à celle du modèle de base autorégressif. Google évoque plusieurs raisons à cela. DiffusionGemma n'a pas été formé en tant que modèle de diffusion dès le départ, mais a été adapté par la suite. La phase d'entraînement subséquente a été relativement courte, et la deuxième étape, SD·RL, a priorisé la vitesse plutôt que la qualité maximale. L'architecture, les données d'entraînement et d'autres paramètres ont également été transférés de l'ancien modèle Gemma 4, qui ne sont pas nécessairement idéaux pour la diffusion.
Le modèle se retrouve parfois coincé dans des boucles de répétition, produisant des mots individuels plusieurs fois de suite. Cela est un artefact des étapes de calcul agressivement réduites. Sur des tâches multimodales, DiffusionGemma oublie parfois de fermer correctement sa section de raisonnement, ce qui tire artificiellement vers le bas les scores de benchmark.
L'avantage de vitesse s'applique principalement aux scénarios à utilisateur unique. Une fois environ 32 requêtes concurrentes atteignent le modèle, les modèles de langage standard rattrapent leur retard en termes de débit.
Google qualifie explicitement DiffusionGemma de modèle expérimental et indique que cette publication vise à accélérer la recherche sur la diffusion de texte tout en fournissant à la communauté une base pour des adaptations spécialisées et économes en ressources.
Le modèle est déjà utilisé par la startup Interfaze pour la reconnaissance vocale multilingue et dans un projet de recherche sur la génération de rapports de radiologie interactifs. Google a précédemment rendu le modèle disponible sous une licence Apache 2.0 sur Hugging Face. Son prédécesseur est Gemini Diffusion, que Google a présenté en mai 2025.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.