Glossaire
IA

Reinforcement Learning from Human Feedback

Aussi : RLHF, Reinforcement Learning from Human Feedback, Human preference fine-tuning

Méthode d'entraînement qui affine les modèles d'IA à partir de jugements de préférence humains, pour aligner leurs réponses sur ce que les gens jugent utile, sûr et de qualité.

De quoi il s'agit

Le Reinforcement Learning from Human Feedback (RLHF) est une technique d'alignement des modèles de machine learning, en particulier des grands modèles de langage, sur les préférences humaines. Plutôt que de s'appuyer uniquement sur les données d'entraînement brutes, le RLHF intègre des jugements humains sur les sorties du modèle jugées meilleures, puis utilise ces jugements pour orienter le modèle vers un comportement plus souhaitable.

Le RLHF combine deux domaines : l'apprentissage supervisé (apprendre à partir d'exemples labellisés) et le reinforcement learning (apprendre à partir d'un signal de récompense). L'idée clé : les humains sont souvent meilleurs pour *comparer* deux réponses que pour rédiger la réponse parfaite depuis zéro. Le RLHF transforme donc les préférences humaines en une récompense que le modèle peut optimiser.

Pourquoi c'est important

Un modèle entraîné uniquement à prédire du texte peut être fluide mais inutile, évasif ou dangereux. Le RLHF réduit l'écart entre ce qu'un modèle *peut* produire et ce que les utilisateurs veulent réellement. C'est une des raisons majeures pour lesquelles les assistants conversationnels modernes paraissent coopératifs, suivent les instructions et refusent les demandes manifestement nuisibles.

  • Alignement : les sorties correspondent mieux à l'intention et aux valeurs humaines.
  • Qualité : les réponses deviennent plus utiles, plus concises et plus pertinentes.
  • Sécurité : réduction des contenus toxiques, biaisés ou dangereux.

Comment ça marche en pratique

Le RLHF suit en général trois étapes :

1. Supervised fine-tuning (SFT) : des humains rédigent ou sélectionnent des réponses exemples, et le modèle de base est fine-tuné dessus.

2. Entraînement du reward model : des humains classent ou comparent plusieurs sorties du modèle pour un même prompt. Ces comparaisons entraînent un reward model distinct, qui note la qualité de n'importe quelle réponse.

3. Optimisation de la policy : le modèle principal est fine-tuné avec un algorithme de reinforcement learning (souvent PPO) pour maximiser le score du reward model, généralement sous une contrainte qui le maintient proche du modèle d'origine.

Exemple concret

Supposons qu'on demande à un chatbot : « Expliquez l'inflation à un débutant. » Le modèle génère quatre réponses. Des évaluateurs humains les classent de la meilleure à la moins bonne, en privilégiant les réponses claires, exactes et sans jargon. Le reward model apprend ce schéma. Pendant l'optimisation, le chatbot est poussé à produire des réponses ressemblant à celles les mieux classées. Sur un grand nombre de prompts, il donne des explications plus claires et plus utiles de façon constante.

Limites

Le RLHF hérite des biais humains, le labelling coûte cher, et il peut récompenser des réponses fausses mais formulées avec assurance si les évaluateurs manquent de vigilance. Des variantes comme le RLAIF (feedback généré par l'IA) et la direct preference optimization visent à réduire ces coûts.

RLHF Pipeline1. SupervisedFine-Tuning2. Reward Modelfrom rankings3. PolicyOptimizationHuman reviewersrank outputsreward signal guides updates
The three core stages of RLHF, with human rankings feeding the reward model that guides optimization.

Questions fréquentes

Que signifie RLHF et quel problème cette méthode résout-elle ?

RLHF signifie Reinforcement Learning from Human Feedback. Il s'agit d'une méthode de fine-tuning qui ajuste les modèles de machine learning, en particulier les grands modèles de langage, à partir de jugements humains sur la qualité des réponses. Elle existe parce qu'un modèle entraîné uniquement à prédire le mot suivant peut être fluide tout en restant inutile, évasif ou dangereux.

Pourquoi demande-t-on aux évaluateurs de classer des réponses plutôt que d'écrire la réponse idéale ?

Parce qu'un humain compare deux réponses plus facilement qu'il ne rédige la réponse parfaite. Classer plusieurs candidates pour un même prompt est plus rapide, plus cohérent, et produit un signal convertible en récompense numérique que le modèle cherche ensuite à maximiser.

Quelles sont les trois étapes d'un pipeline RLHF ?

D'abord le supervised fine-tuning (SFT) : des humains rédigent ou sélectionnent des réponses exemples et le modèle de base est fine-tuné dessus. Ensuite l'entraînement du reward model : des humains classent plusieurs sorties pour un même prompt, et ces comparaisons servent à entraîner un modèle distinct qui attribue un score à toute réponse. Enfin l'optimisation de la politique : le modèle principal est fine-tuné par un algorithme de reinforcement learning, souvent PPO, pour maximiser ce score tout en restant proche du modèle d'origine.

Quelle différence entre le reward model et le modèle que l'on entraîne ?

Le reward model est un modèle distinct dont l'unique rôle est de noter la qualité d'une réponse, appris à partir des comparaisons humaines. Le modèle principal, la politique, est celui qui génère les réponses et que l'on ajuste pour obtenir de meilleurs scores. Cette séparation permet d'appliquer les préférences humaines à des milliers de prompts sans faire relire chacun par un humain.

Quelles sont les limites connues du RLHF et quelles alternatives y répondent ?

Le RLHF hérite des biais de ses annotateurs, coûte cher en labellisation, et peut récompenser des réponses assurées mais fausses si les évaluateurs manquent de rigueur. Le RLAIF, qui remplace une partie du feedback humain par du feedback généré par IA, et la direct preference optimization, qui se passe du reward model séparé, ont été développés pour réduire ces coûts.