Brief IA : Google Gemma 4 : Réduction spectaculaire de 72 % et bug 4 bits résolu

Google Gemma 4 : Réduction spectaculaire de 72 % et bug 4 bits résolu

Brief IA
Tom Levy·2 min·22 vues

Google a réduit la taille de son modèle Gemma 4 de 72 %, permettant son exécution sur des GPU grand public, tout en maintenant 26 milliards de paramètres et une génération de 193 tokens par seconde. Cette innovation démontre que des modèles d'IA avancés peuvent désormais être accessibles aux développeurs et entreprises, rendant l'IA plus démocratique.

En bref
1Google a réussi à réduire le modèle Gemma 4 de 72 %, le rendant compatible avec 15 Go de mémoire tout en maintenant une vitesse de 193 tokens par seconde.
2Unsloth a corrigé un bug de désaccord d'échelle dans la conversion GGUF, améliorant l'efficacité des modèles quantifiés en 4 bits.
3Le modèle 26B-A4B de Gemma 4 offre une performance proche de l'original malgré une quantification en 4 bits, défiant les attentes traditionnelles.
💡Pourquoi c'est importantCette avancée permet d'exécuter des modèles de grande taille sur des configurations grand public, élargissant l'accès à la technologie IA avancée.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Google a récemment dévoilé une avancée majeure avec son modèle Gemma 4, qui a été réduit de 72 % tout en maintenant des performances impressionnantes. Ce modèle, doté de 26 milliards de paramètres, fonctionne désormais efficacement avec seulement 15 Go de mémoire, produisant 193 tokens par seconde sur des GPU grand public. Cette prouesse technique permet d'exécuter des modèles de grande taille sur des ordinateurs portables et des configurations de jeu, plutôt que dans des centres de données.

L'innovation réside dans les nouveaux points de contrôle QAT de Gemma 4, qui permettent une quantification pendant l'entraînement. Cela rend le modèle robuste face à l'arrondi en 4 bits, une tâche qui, selon les lois traditionnelles de la quantification, devrait entraîner une perte de performance significative. Cependant, ce n'est pas le cas ici.

Unsloth a joué un rôle crucial en corrigeant un bug subtil de désaccord d'échelle dans la conversion GGUF. Ce bug, s'il n'avait pas été résolu, aurait annulé la plupart des bénéfices lors de la conversion aux formats llama.cpp. Grâce à cette correction, les modèles quantifiés en 4 bits conservent une efficacité remarquable.

L'article détaille également les performances et la mémoire des différentes variantes de Gemma 4, en mettant l'accent sur le modèle 26B-A4B à mélange d'experts. Il compare les conversions naïves et dynamiques et propose des étapes pratiques pour exécuter le modèle avec llama.cpp, ainsi que d'autres options de déploiement comme les serveurs API, Ollama/LM Studio, et Unsloth Studio.

En conclusion, bien que le modèle 4 bits reste limité par sa nature, le compromis habituel entre qualité et vitesse semble s'effondrer. Le modèle 26B-A4B offre une expérience comparable à celle des modèles de grande taille sur des GPU grand public, ouvrant de nouvelles perspectives pour l'IA accessible.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires