Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
DiffusionGemma : une avancée majeure pour la génération de texte
Google a récemment introduit DiffusionGemma, un modèle d'intelligence artificielle qui promet de transformer la génération de texte en augmentant considérablement la vitesse de production. Ce modèle expérimental se distingue par sa capacité à générer du texte jusqu'à quatre fois plus rapidement que les modèles traditionnels. Plutôt que de produire du texte mot par mot, DiffusionGemma génère des blocs entiers simultanément, ce qui représente une avancée significative pour ceux qui recherchent une rapidité accrue.
L'approche de DiffusionGemma repose sur la génération simultanée de centaines de jetons, en exploitant pleinement la puissance des GPU modernes. Cette méthode permet de réduire la latence, un aspect crucial pour les utilisateurs impatients de recevoir des réponses rapides. Google affirme que ce modèle peut atteindre une génération de texte jusqu'à quatre fois plus rapide que les modèles autorégressifs traditionnels.
Une méthode inspirée par la génération d'images
DiffusionGemma adopte une approche inspirée par les modèles de génération d'images par diffusion. Contrairement aux modèles qui construisent une phrase progressivement de gauche à droite, DiffusionGemma génère un bloc entier de texte en parallèle. Le processus commence par un brouillon de texte rempli de jetons aléatoires, qui est ensuite affiné à travers plusieurs passes pour obtenir un résultat cohérent et exploitable.
Cette technique permet d'exploiter pleinement la puissance des GPU modernes, en traitant jusqu'à 256 jetons simultanément. Cela signifie que le modèle utilise efficacement les ressources matérielles disponibles, augmentant ainsi la vitesse de production de texte à un rythme pouvant être jusqu'à quatre fois plus rapide que celui des modèles autorégressifs.
Avantages et compromis de DiffusionGemma
L'un des principaux avantages de cette architecture est son attention bidirectionnelle, qui permet à chaque partie du texte de prendre en compte l'ensemble du paragraphe en cours de génération. Cela est particulièrement utile pour des tâches telles que l'édition, le remplissage de code ou toute autre application où le contexte global est essentiel.
Google indique que DiffusionGemma peut dépasser les 1 000 jetons par seconde sur certains accélérateurs haut de gamme, ce qui est particulièrement attractif pour les développeurs en quête d'interactions quasi instantanées. Le modèle repose sur une architecture Mixture of Experts de 26 milliards de paramètres, dont seulement 3,8 milliards sont activés lors de la génération, réduisant ainsi les besoins en ressources matérielles et permettant son utilisation sur des GPU grand public relativement puissants.
Cependant, cette vitesse accrue a un coût. Google reconnaît que la qualité des réponses générées par DiffusionGemma est inférieure à celle de Gemma 4 dans sa version classique. Par conséquent, ce modèle est davantage destiné à des expérimentations et à des applications où chaque milliseconde compte, plutôt qu'à remplacer les modèles existants de haute qualité.

