Brief IA : Apprentissage par renforcement : On-Policy vs Off-Policy

Apprentissage par renforcement : On-Policy vs Off-Policy

Brief IA
Tom Levy·4 min·7 vues

L'article examine les distinctions entre les approches On-Policy, qui apprennent à partir de la stratégie actuelle de l'agent, et Off-Policy, qui permettent d'apprendre à partir de comportements générés différemment. Ce choix stratégique influence l'exploration et la sécurité des algorithmes, ce qui est crucial pour optimiser l'efficacité des systèmes d'IA dans des environnements complexes. Comprendre ces différences est essentiel pour le succès des applications d'IA dans des secteurs critiques.

En bref
1L'apprentissage par renforcement se divise en méthodes on-policy et off-policy, influençant la stratégie d'un agent.
2Les méthodes on-policy, comme SARSA, améliorent la stratégie actuelle, offrant stabilité mais moins de flexibilité.
3Les méthodes off-policy, telles que Q-learning, permettent l'apprentissage à partir de comportements différents, augmentant l'efficacité des données.
💡Pourquoi c'est importantCes distinctions impactent la manière dont les agents optimisent leurs performances et explorent leur environnement.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Introduction à l'apprentissage par renforcement

L'apprentissage par renforcement est souvent introduit par une série d'algorithmes tels que SARSA, Q-learning, PPO, DQN, et SAC. Chaque nom semble désigner une méthode distincte ou une formulation mathématique particulière. Cependant, ces algorithmes reposent sur une question fondamentale : un agent doit-il apprendre uniquement à partir du comportement qu'il utilise actuellement, ou peut-il également apprendre à partir d'un comportement généré d'une autre manière ? Cette question est au cœur de la distinction entre l'apprentissage on-policy et off-policy.

Définition des termes clés

Pour comprendre cette distinction, il est essentiel de définir certains termes. Dans l'apprentissage par renforcement, une politique est la règle ou la stratégie qu'un agent utilise pour décider quelle action entreprendre dans chaque situation. Une méthode on-policy apprend à partir de la même stratégie que celle que l'agent suit actuellement. En revanche, une méthode off-policy sépare les deux, permettant à l'agent d'agir selon une stratégie tout en apprenant à propos d'une autre.

Cette distinction va au-delà de la simple terminologie. Elle influence des propriétés cruciales d'un algorithme d'apprentissage : comment il explore, combien de données il nécessite, s'il peut apprendre à partir d'anciennes expériences, et la stabilité de l'entraînement.

Exemples pratiques

Prenons l'exemple d'un robot apprenant à se déplacer dans un entrepôt animé. Pour des raisons de sécurité, son comportement pendant l'entraînement doit rester conservateur. Une méthode on-policy améliore directement ce comportement conservateur, tandis qu'une méthode off-policy permet une flexibilité accrue. Par exemple, le robot peut continuer à agir prudemment tout en apprenant, à partir des expériences collectées, une stratégie différente qui pourrait éventuellement être plus performante. Cette séparation entre le comportement d'un agent et ce qu'il apprend est l'idée clé derrière l'apprentissage off-policy.

Ce que vous devez retenir

  • Les méthodes on-policy apprennent à partir de la même stratégie que celle que l'agent utilise pour interagir avec l'environnement. Elles sont souvent plus stables et plus faciles à raisonner, mais elles ne peuvent généralement pas tirer autant parti des anciennes données. SARSA est l'exemple standard d'apprentissage on-policy.

  • Les méthodes off-policy apprennent une stratégie cible en utilisant des données collectées à partir d'une stratégie de comportement différente. Cela les rend plus efficaces en termes de données et leur permet d'apprendre à partir de tampons de répétition, de données enregistrées ou de l'expérience d'un autre agent, mais l'entraînement peut être moins stable. Q-learning est l'exemple standard d'apprentissage off-policy.

  • Expected SARSA se situe entre les deux en prenant une attente sur les actions suivantes, ce qui réduit souvent la variance et peut être utilisé dans un cadre on-policy ou off-policy.

Cette distinction influence certaines des propriétés les plus importantes d'un système d'apprentissage par renforcement, y compris l'exploration, l'efficacité des échantillons, la stabilité et la sécurité pendant l'apprentissage.

Comprendre ce qu'un agent essaie d'apprendre

Avant de comparer des algorithmes comme SARSA et Q-learning, il est utile de comprendre ce que l'agent essaie réellement d'apprendre. Dans la plupart des méthodes d'apprentissage par renforcement tabulaires, l'agent n'apprend pas directement des actions ; il apprend des estimations de la qualité des différentes actions dans différentes situations.

Une notion centrale dans l'apprentissage par renforcement est la fonction de valeur d'action, généralement notée Q(s, a). En termes simples, cette fonction mesure la qualité de l'action (a) dans l'état (s), en tenant compte non seulement de la récompense immédiate, mais aussi des récompenses futures qui peuvent suivre.

Fonction de valeur d'action

Plus précisément, sous une politique π, la fonction de valeur d'action est définie comme le retour attendu lorsque nous commençons dans l'état s, prenons l'action a, puis suivons la politique π pour toujours après :

[ Q(s, a) = \mathbb{E}[G_t | s_t = s, a_t = a] ]

G_t est le retour total actualisé à partir du moment t.

Distinction entre on-policy et off-policy

Nous devons retenir deux termes importants :

  • Politique cible (π) : la politique que l'agent essaie d'évaluer ou d'améliorer.
  • Politique de comportement (b) : la politique qui génère réellement l'expérience.

Avec ces définitions, nous pouvons énoncer la distinction clairement :

  • Dans l'apprentissage on-policy, l'agent apprend à propos de la même politique qu'il utilise pour agir. Cela signifie que la politique cible et la politique de comportement sont les mêmes : (π = b).

  • Dans l'apprentissage off-policy, l'agent apprend à propos d'une politique tout en suivant une autre. Dans ce cas, la politique cible et la politique de comportement sont différentes : (π ≠ b).

Cette différence peut sembler mineure, mais elle a de grandes conséquences.

Conclusion

Dans une méthode on-policy, l'agent améliore la stratégie qu'il utilise réellement dans l'environnement. Dans une méthode off-policy, l'agent peut agir d'une manière, peut-être prudemment ou aléatoirement pour explorer, tout en apprenant à propos d'une stratégie différente en arrière-plan. Cette séparation permet aux méthodes off-policy de réutiliser d'anciennes données, d'apprendre à partir d'actions exploratoires et même de bénéficier de l'expérience collectée par un autre agent.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires