La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Granite 4.1 : Une nouvelle ère pour les modèles de langage
Granite 4.1 représente une avancée significative dans le domaine des modèles de langage de grande taille (LLM). Cette famille de modèles, comprenant des versions de 3 milliards, 8 milliards et 30 milliards de paramètres, utilise une architecture dense et uniquement décodeur. Ces modèles ont été formés sur environ 15 trillions de tokens grâce à un pipeline de pré-formation en plusieurs étapes, intégrant une extension de contexte long pouvant atteindre jusqu'à 512 000 tokens.
Architecture du modèle
Les modèles Granite 4.1 reposent sur une architecture de transformateur dense avec des innovations telles que le Grouped Query Attention (GQA), les Rotary Position Embeddings (RoPE), les activations SwiGLU, RMSNorm, et les Shared input/output embeddings. Tous les modèles partagent un pipeline d'entraînement commun, différant uniquement par leurs dimensions architecturales.
Granite 4.1 est formé à partir de zéro sur environ 15 trillions de tokens en utilisant une stratégie d'entraînement en cinq phases. Les phases 1 et 2 se concentrent sur la pré-formation fondamentale, les phases 3 et 4 effectuent un entraînement intermédiaire avec un mélange de données de qualité progressivement plus élevée, et la phase 5 introduit un entraînement de contexte long, étendant la fenêtre de contexte à 512K tokens. Chaque phase utilise un mélange de données distinct et un calendrier de taux d'apprentissage, passant progressivement de données web à grande échelle à un contenu plus spécifique au domaine.
Phases de pré-formation
Phase 1 : Pré-formation Générale (10T tokens)
Cette phase établit une compréhension linguistique large à l'aide d'un mélange général de données d'entraînement avec un calendrier de taux d'apprentissage dynamique.
Composition des données :
- CommonCrawl ~59% — données web générales
- Code ~20% — langages de programmation et dépôts
- Math ~7% — données de raisonnement mathématique
- Technique ~10.5% — articles scientifiques, documentation technique et manuels
- Multilingue ~2% — données en langues non anglaises
- Spécifique au domaine ~1.5% — contenu spécifique au domaine
Phase 2 : Pré-formation Math/Code (2T tokens)
La phase 2 augmente fortement la proportion de données de code et mathématiques, se dirigeant vers des capacités de raisonnement plus solides tout en maintenant une couverture linguistique générale.
Composition des données :
- Math ~35% — augmentation de 5x par rapport à la phase 1
- Code ~30% — augmentation de 1.5x
- CommonCrawl-HQ ~12% — sous-ensemble de haute qualité de CommonCrawl
- Synthétique ~9% — données synthétiques de haute qualité
- Multilingue ~3%
Phase 3 : Affinage des Données de Haute Qualité (2T tokens)
La phase 3 passe à un entraînement intermédiaire avec un mélange plus équilibré et de haute qualité et un calendrier de taux d'apprentissage à décroissance exponentielle.
Composition des données :
- CommonCrawl-HQ ~16.67%
- Technique ~12.5%
- Multilingue ~4.5%
- Long Chain-of-Thought ~12.5% — trajectoires de raisonnement
- Instructions Linguistiques ~7.5% — données d'ajustement d'instructions
- Instructions de Code ~4.5% — données d'ajustement d'instructions
Phase 4 : Affinage des Données de Haute Qualité (0.5T tokens)
La quatrième phase continue l'entraînement intermédiaire avec une décroissance linéaire du taux d'apprentissage à zéro, concentrant le modèle sur les données de la plus haute qualité disponibles.
Composition des données :
- CommonCrawl-HQ ~40%
- Long Chain-of-Thought ~6%
- Instructions de Code ~5%
- Instructions Linguistiques ~9%
Phase 5 : Entraînement de Contexte Long (LCE)
La cinquième et dernière phase, également partie de l'entraînement intermédiaire, étend la fenêtre de contexte de 4K à 512K à travers un processus d'extension de contexte long par étapes :
- Extension 32K — utilisant le même mélange de données que la phase 4
- Extension 128K — même mélange de données que la phase 4
- Extension 512K — 80% livres + 20% données de dépôts de code (8B et 30B uniquement)
La phase LCE utilise un calendrier de taux d'apprentissage exponentiel commençant à 1e-4 et décroissant vers 0. Pour garantir que le modèle gère nativement de longues séquences sans dégrader les performances en contexte court, nous effectuons une fusion de modèles après chaque étape LCE.
SFT : Préparation des Données et Contrôle de Qualité
Le fine-tuning supervisé (SFT) transforme le modèle de base en un assistant fiable suivant les instructions, rendant la qualité des données cruciale. Même un petit nombre d'échantillons incorrects ou hallucinés peut induire des comportements indésirables. Pour y remédier, nous appliquons un cadre rigoureux LLM-as-Judge associé à un filtrage basé sur des règles pour sélectionner des échantillons de haute qualité. Ensemble, le pipeline évalue automatiquement chaque échantillon selon des critères structurels, sémantiques et comportementaux, corrigeant les problèmes lorsque cela est possible et filtrant les échantillons qui ne répondent pas à nos normes de qualité.
Détails de l'Entraînement SFT
Après avoir passé par le cadre LLM-as-Judge, le filtrage basé sur des règles et le pipeline de dé-duplication global, nous affinons les modèles de base sur ces environ 4,1 millions d'échantillons de haute qualité. Les détails suivants s'appliquent à toutes les variantes de modèle :
- Configuration d'entraînement :
- 16 nœuds, 4x GB200 par nœud
- 5e-6 (échauffement linéaire 3%, décroissance linéaire sur ~25K étapes)
- Taille de lot efficace : 256 échantillons/itération (~4.2M tokens/itération)
Apprentissage par Renforcement : Pipeline RL Multi-Étapes
Après le SFT, nous appliquons un pipeline d'apprentissage par renforcement multi-étapes pour améliorer davantage les capacités du modèle dans des domaines spécifiques. Plutôt qu'un seul passage RL, nous exécutons plusieurs étapes RL ciblées, chacune optimisant différentes capacités.
Méthodologie d'Entraînement
Nous utilisons GRPO (Group Relative Policy Optimization) avec perte DAPO, qui fournit des signaux d'entraînement plus stables par rapport au GRPO standard. Cependant, en raison de la nature computationnellement intensive de l'échantillonnage dynamique, nous le désactivons pendant nos sessions d'entraînement.
Configuration d'Entraînement RL
- GRPO en mode on-policy avec perte DAPO
Le pipeline d'apprentissage par renforcement pour l'entraînement des modèles Granite 4.1 se compose de quatre étapes séquentielles : RL multi-domaines, RLHF, Calibration d'Identité et de Connaissance, et RL Math. Dans cette étape, le modèle est entraîné conjointement sur un mélange unifié de données tirées de plusieurs domaines. Chaque mise à jour de gradient reflète donc la pleine diversité des tâches, ce qui empêche l'oubli catastrophique, améliore les performances globales sur les benchmarks et minimise les régressions sur toute tâche individuelle.
Performances et licence
Notamment, le modèle instructif 8B de Granite 4.1 égale ou dépasse les performances du modèle précédent Granite 4.0-H-Small (32B-A9B MoE), malgré une architecture dense plus simple et un nombre de paramètres réduit. Tous les modèles Granite 4.1 sont publiés sous la licence Apache 2.0, facilitant leur utilisation et leur adaptation par la communauté.
