La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Une nouvelle famille de modèles de langage, Granite 4.2, mise sur un entraînement en cinq phases, une fenêtre de 512K tokens et un apprentissage par renforcement étagé. Les versions 8B et 30B apprennent à manipuler des outils en environnements réels, tandis qu’un contrôle qualité serré encadre un corpus SFT de 7,2 M d’exemples. L’ensemble est publié sous licence Apache 2.0 et s’intègre aux endpoints compatibles OpenAI.
Un RL asynchrone, par étapes, calibré sur des lots de 4 096
Après l’affinage supervisé, Granite 4.2 applique un pipeline d’apprentissage par renforcement composé d’étapes ciblant des capacités distinctes, de la résolution mathématique au suivi d’instructions, puis l’ingénierie logicielle, l’usage du terminal et la recherche web. Chaque étape correspond à un passage indépendant qui reprend à partir du point de contrôle de l’étape précédente. L’entraînement utilise une variante GRPO asynchrone : des travailleurs génèrent en continu, un tampon partagé collecte les trajectoires, et l’entraîneur optimise sans bloquer la génération. Des rafraîchissements de politique peuvent survenir en cours de déroulement, les travailleurs réutilisant leur cache KV. Une limite empêche les travailleurs de prendre plus d’une mise à jour de retard sur l’entraîneur, et l’objectif applique un échantillonnage d’importance tronqué pour plafonner le rapport de probabilité et éviter qu’un petit nombre de tokens obsolètes n’influence une mise à jour. Les avantages sont calculés relativement au groupe avec une base leave-one-out, supprimant le besoin d’un réseau de valeur séparé. La première étape, RLVR, associe 256 invites à 16 réponses chacune, soit un lot de 4 096 exemples consommé en une optimisation unique avant le déroulement suivant. Les étapes ultérieures conservent cette mécanique. Les modèles 8B et 30B incluent en outre un bloc de RL agentique leur apprenant l’appel d’outils, l’édition et l’exécution de code, l’utilisation d’un terminal et la recherche web en environnements réels.
SFT : normalisation OpenAI chat, juges LLM et dé-duplication SHA-256
Le pipeline SFT est précédé d’un contrôle qualité en plusieurs étapes. Les données issues de sources variées sont normalisées dans un format de chat OpenAI unifié, y compris pour structurer les interactions avec les outils. Deux modèles, GPT-OSS-120B et Gemma 4, évaluent la qualité des échantillons ; ceux notés faiblement, comportant des informations fabriquées ou des interactions d’outils invalides, ainsi que des appels à des fonctions non listées, sont retirés. Des heuristiques ciblées par jeu de données éliminent des bruits identifiés. Une dé-duplication locale et globale, basée sur des hachages SHA-256 calculés sur les champs messages et outils, supprime les doublons au sein de chaque source et à l’échelle du mélange total.
Un corpus SFT de 7,2 M d’échantillons, dont 31,6% agentiques
Le mélange SFT comprend 31,6% de données agentiques et 68,4% non agentiques, pour environ 7,2 millions d’échantillons et près de 100 milliards de tokens, dont 65 milliards entraînables. Côté agentique, l’ingénierie logicielle représente 69%, l’appel d’outils 12,1%, l’usage du terminal 8,0%, les mathématiques 3,5%, la recherche 0,8% et des actions 0,2%. Ces trajectoires proviennent d’un large éventail de harnais et frameworks, dont OpenHands, OpenCode, Terminus-2, SWE-agent, OpenResearcher, MiniSWE, OpenSeeker, EnvScaler, Gemini CLI, Hermes, Codex et Goose, mêlant jeux open source et environnements RL synthétiques internes. Côté non agentique, le suivi d’instructions et le codage totalisent chacun 18,8%, les mathématiques 14,6%, le multilingue 7,0%, les sciences 5,4%, le raisonnement 3,0% et la sécurité 0,8%. Ce corpus vise à faire du modèle un assistant fiable pour instructions, raisonnement et outils.
Granite 4.2 utilise un transformeur décodeur dense avec RoPE
Granite 4.2 repose sur un transformeur dense uniquement décodeur : attention GQA avec 40 têtes et 8 têtes KV, encodage positionnel RoPE avec θ=10 000 000, MLP en SwiGLU, RMSNorm avec ε=1e-5, embeddings d’entrée et de sortie non liés et précision bfloat16. L’entraînement initial des modèles s’effectue à partir de zéro, sur environ 15 T de tokens, répartis en cinq étapes distinctes. Les deux premières étapes servent à poser les bases, les troisième et quatrième correspondent à un entraînement intermédiaire marqué par une diminution progressive de la qualité des données, tandis que la cinquième étape permet d’intégrer le long contexte, étendant la fenêtre à 512K tokens. À chaque étape, un mélange de données spécifique et un calendrier de taux d’apprentissage propre sont utilisés, avec une évolution allant de vastes sources web vers des corpus plus filtrés.
Intégration : endpoint OpenAI, vLLM et support SGLang
Les modèles génèrent des appels d’outils selon le format d’appel de fonction OpenAI et sont compatibles avec des endpoints tels que vLLM, sans nécessiter de couche d’intégration supplémentaire pour les harnais agentiques. Pour l’interaction, chaque modèle inclut un interrupteur pensée/non-pensée, un mode de réflexion allégée pour les situations simples, ainsi que la possibilité de générer une chaîne de pensée avant la réponse. Granite 4.2 est également pris en charge dans SGLang.
Gamme, licence Apache 2.0 et réglages SFT à l’échelle
La gamme couvre trois tailles, 3B, 8B et 30B, partageant architecture et pipeline d’entraînement, avec des écarts de capacités mis en évidence après le post-entraînement. Le 30B reçoit une seconde phase SFT dédiée au codage agentique : suréchantillonnage des données agentiques, SWE et de codage, conservation d’environ 16% de données de répétition, et une époque supplémentaire avec un taux d’apprentissage de 3.0e-6. Les exécutions SFT finales s’appuient sur 32 à 128 nœuds par taille de modèle, chaque nœud offrant 4 accélérateurs Grace/GB200. Les réglages incluent un taux d’apprentissage de 1.0e-5 constant après warmup (2,5% des itérations), TP=2, PP=1 et CP=4 ou 2. L’ensemble de la famille est publié sous licence Apache 2.0.






