Brief IA : Granite 4.1 : Révolution des modèles de langage avec 512K tokens

Granite 4.1 : Révolution des modèles de langage avec 512K tokens

Brief IA
Tom Levy·6 min·10 vues

Granite 4.1 est une famille de modèles de langage de grande taille (LLM) développée avec une architecture dense uniquement décodeur, formée sur environ 15 trillions de tokens et capable de traiter des contextes longs allant jusqu'à 512K tokens. Ce développement s'inscrit dans une compétition croissante entre entreprises technologiques pour dominer le marché des LLMs, ce qui pourrait transformer les interactions humaines avec la technologie et ouvrir de nouvelles opportunités commerciales.

En bref
1Granite 4.1 introduit des modèles de langage à architecture dense, formés sur 15 trillions de tokens, avec une fenêtre de contexte étendue à 512K tokens.
2Le modèle 8B de Granite 4.1 surpasse son prédécesseur Granite 4.0-H-Small malgré une architecture plus simple et moins de paramètres.
3Un processus de fine-tuning supervisé et un apprentissage par renforcement optimisent les modèles avec 4,1 millions d'échantillons de haute qualité.
💡Pourquoi c'est importantGranite 4.1 redéfinit les capacités des modèles de langage en augmentant la taille du contexte, ce qui pourrait transformer les applications d'IA nécessitant une compréhension approfondie et contextuelle.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Granite 4.1 : Une nouvelle ère pour les modèles de langage

Granite 4.1 représente une avancée significative dans le domaine des modèles de langage de grande taille (LLM). Cette famille de modèles, comprenant des versions de 3 milliards, 8 milliards et 30 milliards de paramètres, utilise une architecture dense et uniquement décodeur. Ces modèles ont été formés sur environ 15 trillions de tokens grâce à un pipeline de pré-formation en plusieurs étapes, intégrant une extension de contexte long pouvant atteindre jusqu'à 512 000 tokens.

Architecture du modèle

Les modèles Granite 4.1 reposent sur une architecture de transformateur dense avec des innovations telles que le Grouped Query Attention (GQA), les Rotary Position Embeddings (RoPE), les activations SwiGLU, RMSNorm, et les Shared input/output embeddings. Tous les modèles partagent un pipeline d'entraînement commun, différant uniquement par leurs dimensions architecturales.

Granite 4.1 est formé à partir de zéro sur environ 15 trillions de tokens en utilisant une stratégie d'entraînement en cinq phases. Les phases 1 et 2 se concentrent sur la pré-formation fondamentale, les phases 3 et 4 effectuent un entraînement intermédiaire avec un mélange de données de qualité progressivement plus élevée, et la phase 5 introduit un entraînement de contexte long, étendant la fenêtre de contexte à 512K tokens. Chaque phase utilise un mélange de données distinct et un calendrier de taux d'apprentissage, passant progressivement de données web à grande échelle à un contenu plus spécifique au domaine.

Phases de pré-formation

Phase 1 : Pré-formation Générale (10T tokens)

Cette phase établit une compréhension linguistique large à l'aide d'un mélange général de données d'entraînement avec un calendrier de taux d'apprentissage dynamique.

Composition des données :

  • CommonCrawl ~59% — données web générales
  • Code ~20% — langages de programmation et dépôts
  • Math ~7% — données de raisonnement mathématique
  • Technique ~10.5% — articles scientifiques, documentation technique et manuels
  • Multilingue ~2% — données en langues non anglaises
  • Spécifique au domaine ~1.5% — contenu spécifique au domaine

Phase 2 : Pré-formation Math/Code (2T tokens)

La phase 2 augmente fortement la proportion de données de code et mathématiques, se dirigeant vers des capacités de raisonnement plus solides tout en maintenant une couverture linguistique générale.

Composition des données :

  • Math ~35% — augmentation de 5x par rapport à la phase 1
  • Code ~30% — augmentation de 1.5x
  • CommonCrawl-HQ ~12% — sous-ensemble de haute qualité de CommonCrawl
  • Synthétique ~9% — données synthétiques de haute qualité
  • Multilingue ~3%

Phase 3 : Affinage des Données de Haute Qualité (2T tokens)

La phase 3 passe à un entraînement intermédiaire avec un mélange plus équilibré et de haute qualité et un calendrier de taux d'apprentissage à décroissance exponentielle.

Composition des données :

  • CommonCrawl-HQ ~16.67%
  • Technique ~12.5%
  • Multilingue ~4.5%
  • Long Chain-of-Thought ~12.5% — trajectoires de raisonnement
  • Instructions Linguistiques ~7.5% — données d'ajustement d'instructions
  • Instructions de Code ~4.5% — données d'ajustement d'instructions

Phase 4 : Affinage des Données de Haute Qualité (0.5T tokens)

La quatrième phase continue l'entraînement intermédiaire avec une décroissance linéaire du taux d'apprentissage à zéro, concentrant le modèle sur les données de la plus haute qualité disponibles.

Composition des données :

  • CommonCrawl-HQ ~40%
  • Long Chain-of-Thought ~6%
  • Instructions de Code ~5%
  • Instructions Linguistiques ~9%

Phase 5 : Entraînement de Contexte Long (LCE)

La cinquième et dernière phase, également partie de l'entraînement intermédiaire, étend la fenêtre de contexte de 4K à 512K à travers un processus d'extension de contexte long par étapes :

  • Extension 32K — utilisant le même mélange de données que la phase 4
  • Extension 128K — même mélange de données que la phase 4
  • Extension 512K — 80% livres + 20% données de dépôts de code (8B et 30B uniquement)

La phase LCE utilise un calendrier de taux d'apprentissage exponentiel commençant à 1e-4 et décroissant vers 0. Pour garantir que le modèle gère nativement de longues séquences sans dégrader les performances en contexte court, nous effectuons une fusion de modèles après chaque étape LCE.

SFT : Préparation des Données et Contrôle de Qualité

Le fine-tuning supervisé (SFT) transforme le modèle de base en un assistant fiable suivant les instructions, rendant la qualité des données cruciale. Même un petit nombre d'échantillons incorrects ou hallucinés peut induire des comportements indésirables. Pour y remédier, nous appliquons un cadre rigoureux LLM-as-Judge associé à un filtrage basé sur des règles pour sélectionner des échantillons de haute qualité. Ensemble, le pipeline évalue automatiquement chaque échantillon selon des critères structurels, sémantiques et comportementaux, corrigeant les problèmes lorsque cela est possible et filtrant les échantillons qui ne répondent pas à nos normes de qualité.

Détails de l'Entraînement SFT

Après avoir passé par le cadre LLM-as-Judge, le filtrage basé sur des règles et le pipeline de dé-duplication global, nous affinons les modèles de base sur ces environ 4,1 millions d'échantillons de haute qualité. Les détails suivants s'appliquent à toutes les variantes de modèle :

  • Configuration d'entraînement :
    • 16 nœuds, 4x GB200 par nœud
    • 5e-6 (échauffement linéaire 3%, décroissance linéaire sur ~25K étapes)
    • Taille de lot efficace : 256 échantillons/itération (~4.2M tokens/itération)

Apprentissage par Renforcement : Pipeline RL Multi-Étapes

Après le SFT, nous appliquons un pipeline d'apprentissage par renforcement multi-étapes pour améliorer davantage les capacités du modèle dans des domaines spécifiques. Plutôt qu'un seul passage RL, nous exécutons plusieurs étapes RL ciblées, chacune optimisant différentes capacités.

Méthodologie d'Entraînement

Nous utilisons GRPO (Group Relative Policy Optimization) avec perte DAPO, qui fournit des signaux d'entraînement plus stables par rapport au GRPO standard. Cependant, en raison de la nature computationnellement intensive de l'échantillonnage dynamique, nous le désactivons pendant nos sessions d'entraînement.

Configuration d'Entraînement RL

  • GRPO en mode on-policy avec perte DAPO

Le pipeline d'apprentissage par renforcement pour l'entraînement des modèles Granite 4.1 se compose de quatre étapes séquentielles : RL multi-domaines, RLHF, Calibration d'Identité et de Connaissance, et RL Math. Dans cette étape, le modèle est entraîné conjointement sur un mélange unifié de données tirées de plusieurs domaines. Chaque mise à jour de gradient reflète donc la pleine diversité des tâches, ce qui empêche l'oubli catastrophique, améliore les performances globales sur les benchmarks et minimise les régressions sur toute tâche individuelle.

Performances et licence

Notamment, le modèle instructif 8B de Granite 4.1 égale ou dépasse les performances du modèle précédent Granite 4.0-H-Small (32B-A9B MoE), malgré une architecture dense plus simple et un nombre de paramètres réduit. Tous les modèles Granite 4.1 sont publiés sous la licence Apache 2.0, facilitant leur utilisation et leur adaptation par la communauté.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires