Brief IA : GRPO : entraîner des petits modèles avec des scores vérifiables

GRPO : entraîner des petits modèles avec des scores vérifiables

Brief IA
Tom Levy·5 min·0 vues

L'approche GRPO, développée par DeepSeekMath, permet d'entraîner des modèles en comparant plusieurs sorties basées sur des scores vérifiables, réduisant ainsi la mémoire nécessaire. Cette méthode rend l'apprentissage par renforcement accessible sur de petits modèles, mais son efficacité dépend de la rigueur des règles de récompense et de la gestion des ressources. Une mauvaise définition des fonctions de score peut conduire à des comportements indésirables.

En bref
1GRPO entraîne des modèles en comparant plusieurs sorties sur la base de scores vérifiables, sans critique appris, ce qui réduit la mémoire nécessaire
2La conception des fonctions de score est déterminante : mal définies, elles peuvent favoriser de mauvais comportements
3LoRA, QLoRA et des outils comme Unsloth facilitent l’entraînement local, à condition d’anticiper les critères de vérification et la difficulté des tâches
💡Pourquoi c'est importantCes méthodes rendent l’apprentissage par renforcement accessible sur de petits modèles, mais leur efficacité dépend de la rigueur des règles de récompense et de la gestion des ressources.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Comparer plusieurs tentatives d’un même modèle plutôt que d’entraîner un critique dédié : c’est l’approche GRPO, née dans DeepSeekMath. Elle s’appuie sur des récompenses vérifiables et sur des techniques d’économie de mémoire pour rendre possible un entraînement local. À une condition centrale : que la règle de notation définisse correctement le succès.

Définir la récompense oriente l’apprentissage, bon comme mauvais

Récompenser la simple présence d’une chaîne, comme 42, peut valider des réponses incorrectes qui la mentionnent sans fournir le bon résultat. L’illustration impose donc un bloc unique de réponse finale, sans texte après, et extrait un entier via une expression régulière limitée à 12 chiffres avec signe éventuel. La fonction de parsing renvoie None quand le format est invalide, ce qui distingue un zéro valide d’un échec d’analyse, puis une fonction de score renvoie 1.0 si l’entier correspond à l’attendu, sinon 0.0. Le parseur accepte espaces, signes et zéros en tête mais rejette doublons de blocs, texte de fin, décimales et nombres à virgules, un choix adapté à une tâche d’entier construite mais trop étroit pour une vérification mathématique générale. Ces décisions expliquent pourquoi des notations binaires peuvent écarter 42.0 bien qu’équivalent, et pourquoi certaines tâches exigent unités ou équivalences de fractions. En pratique, ces choix déterminent les sorties favorisées : un modèle peut surtout apprendre les balises exigées plutôt que l’arithmétique, d’où la nécessité de suivre séparément les réponses malformées. Il est préférable d’arrêter ces critères avant de configurer l’entraînement, faute de quoi une hausse du score peut ne refléter qu’une meilleure adaptation au vérificateur plutôt qu’une résolution accrue de problèmes.

Ce que vérifie l’issue ne dit pas du raisonnement intermédiaire

Un modèle peut annoncer qu’il vérifie ou reconsidère un calcul et pourtant se tromper : pour l’évaluation d’exactitude, le nombre final compte. La vérification par exécution, illustrée par l’assertion Python confirmant que 6×8−6 égale 42, permet d’employer des paires question-réponse sans solutions détaillées. Dans ce schéma, la question est fournie au modèle tandis que la valeur attendue demeure côté vérificateur ; le score attribué à la sortie guide ensuite l’ajustement. C’est l’intérêt de récompenses vérifiables : un retour objectif issu du résultat. Mais vérifier seulement l’entier final ne garantit pas la cohérence du raisonnement suivi pour y parvenir.

GRPO remplace le critique de PPO par un groupe de sorties

Introduit dans DeepSeekMath, GRPO est une alternative au PPO acteur-critique, qui entraîne d’ordinaire un estimateur de valeur comme base de jugement. Ici, la base vient d’un groupe de réponses produites pour le même prompt : on compare leur réussite effective. Dans un exemple à quatre tentatives scorées 1, 0, 1, 0, la moyenne est 0,5 et l’avantage s’obtient par normalisation par l’écart-type, ce qui peut donner des valeurs telles que [1.0, −1.0, 1.0, −1.0], l’implémentation exacte pouvant varier. L’optimiseur augmente la probabilité des sorties à forte récompense par rapport aux autres ; le signal reste global à la réponse et ne localise pas l’étape décisive. Des mécanismes comme le clipping et, selon les configurations, une pénalité de dérive par rapport à une politique de référence, bornent les mises à jour. Lorsque toutes les réponses d’un groupe ont la même récompense, l’avantage devient nul, et la tâche n’apporte alors aucun différentiel utile. À l’inverse, si les succès sont trop rares, l’algorithme manque d’orientation ; s’ils sont quasi systématiques, la marge de progression diminue. L’apprentissage suppose des différences informatives fréquentes au sein des groupes.

Moins de mémoire grâce à GRPO, LoRA et QLoRA, mais pas sans coût

Supprimer le critique appris réduit l’empreinte mémoire, et l’entraînement local devient plus abordable lorsqu’on limite les paramètres mis à jour et qu’on stocke les poids plus efficacement. LoRA encode les mises à jour sous forme de matrices à faible rang, ce qui réduit la quantité de paramètres pour lesquels il faut calculer les gradients et stocker l’état de l’optimiseur. QLoRA associe des adaptateurs à une base quantifiée en quatre bits et recourt à d’autres méthodes pour économiser la mémoire. Ces approches n’éliminent toutefois pas le coût de génération et de traitement des réponses pendant l’entraînement. Des outils comme Unsloth agrègent ces idées dans des workflows pratiques incluant l’apprentissage par renforcement fondé sur GRPO, avec une documentation couvrant l’intégration. L’ensemble de ces leviers contribue à rendre plus accessibles des expériences de raisonnement à petite échelle.

Ce que disent les modèles DeepSeek sur l’entraînement sans supervision

R1-Zero de DeepSeek a mis en avant un entraînement par renforcement sans pré-entraînement supervisé, avec des comportements rapportés de réévaluation d’approche et d’usage accru de jetons sur les problèmes difficiles. DeepSeek-R1 a de son côté recouru à un pipeline plus large, incluant des données de démarrage à froid, et les deux processus ne sont pas interchangeables. Dans ce contexte, GRPO retient l’attention pour la modestie du retour requis : le modèle produit plusieurs réponses à une même question, chacune est scorée, et les différences guident l’ajustement. La vérification peut se limiter à l’issue, sans solution de référence à imiter, ce qui recentre la difficulté sur la définition des scores et leur rôle dans la mise à jour du modèle.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires