La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Google a récemment dévoilé une avancée majeure avec son modèle Gemma 4, qui a été réduit de 72 % tout en maintenant des performances impressionnantes. Ce modèle, doté de 26 milliards de paramètres, fonctionne désormais efficacement avec seulement 15 Go de mémoire, produisant 193 tokens par seconde sur des GPU grand public. Cette prouesse technique permet d'exécuter des modèles de grande taille sur des ordinateurs portables et des configurations de jeu, plutôt que dans des centres de données.
L'innovation réside dans les nouveaux points de contrôle QAT de Gemma 4, qui permettent une quantification pendant l'entraînement. Cela rend le modèle robuste face à l'arrondi en 4 bits, une tâche qui, selon les lois traditionnelles de la quantification, devrait entraîner une perte de performance significative. Cependant, ce n'est pas le cas ici.
Unsloth a joué un rôle crucial en corrigeant un bug subtil de désaccord d'échelle dans la conversion GGUF. Ce bug, s'il n'avait pas été résolu, aurait annulé la plupart des bénéfices lors de la conversion aux formats llama.cpp. Grâce à cette correction, les modèles quantifiés en 4 bits conservent une efficacité remarquable.
L'article détaille également les performances et la mémoire des différentes variantes de Gemma 4, en mettant l'accent sur le modèle 26B-A4B à mélange d'experts. Il compare les conversions naïves et dynamiques et propose des étapes pratiques pour exécuter le modèle avec llama.cpp, ainsi que d'autres options de déploiement comme les serveurs API, Ollama/LM Studio, et Unsloth Studio.
En conclusion, bien que le modèle 4 bits reste limité par sa nature, le compromis habituel entre qualité et vitesse semble s'effondrer. Le modèle 26B-A4B offre une expérience comparable à celle des modèles de grande taille sur des GPU grand public, ouvrant de nouvelles perspectives pour l'IA accessible.



