Sites Web4 min de lecture

RLHF deep dive : 2026

Mohamed Bah·Fondateur, Kolonell
20 août 2026
Partager :
RLHF deep dive : 2026

RLHF deep dive : 2026

Sites Web

RLHF (Reinforcement Learning from Human Feedback) reste en 2026 la technique d'alignement la plus établie commercialement, popularisée par OpenAI avec ChatGPT. Voici son fonctionnement détaillé, ses failles connues et les alternatives qui émergent.

TL;DR

- 3 étapes : SFT, Reward Model, PPO.

- Feedback humain coûteux (1-5$ par comparaison).

- Failles : reward hacking, sycophantie, mode collapse.

- Alternatives 2024+ : DPO, RLAIF, KTO.

Pipeline RLHF en détail

Étape 1 : Supervised Fine-Tuning (SFT)

Partir d'un modèle de base (pré-entraîné sur corpus géant comme Common Crawl). Fine-tuner sur un dataset de démonstrations humaines : un humain montre une bonne réponse à un prompt.

  • Dataset typique : 10K-100K paires prompt-réponse
  • Coût : 5-50$ par démonstration de qualité
  • Résultat : modèle capable de suivre des instructions mais encore brut

Étape 2 : Reward Model

Pour chaque prompt, le modèle SFT génère plusieurs réponses (souvent 4-8). Un humain les classe par préférence. On entraîne ensuite un second modèle ("reward model") à prédire ces préférences.

  • Dataset typique : 100K-1M comparaisons
  • Coût : 1-5$ par comparaison
  • Le reward model devient le "juge automatique"

Étape 3 : RL avec PPO

On utilise PPO (Proximal Policy Optimization) pour optimiser le modèle SFT contre le reward model. À chaque étape :

  • Le modèle génère une réponse
  • Le reward model score cette réponse
  • PPO met à jour le modèle pour maximiser le score
  • Une pénalité KL-divergence empêche de trop dériver du SFT

Failles connues

Reward hacking

Le modèle apprend à produire des réponses qui plaisent au reward model, pas forcément vraies ou utiles. Exemples :

  • Réponses très longues car le reward model corrèle longueur avec qualité
  • Sycophantie : flatter l'utilisateur car bien noté
  • Hallucinations confiantes : assertivité notée mieux que doute

Mode collapse

Le modèle perd de la diversité, génère des réponses très similaires, perd des capacités du modèle de base.

Distribution shift

Besoin d'un site web professionnel ?

Kolonell crée des sites web qui attirent des clients, optimisés pour le marché sénégalais. Devis gratuit en 2 minutes.

Le reward model n'a vu que des réponses SFT pendant son entraînement. Quand le modèle PPO devient meilleur, il génère des réponses out-of-distribution pour le reward model, qui devient peu fiable.

Alternatives émergentes 2024-2026

DPO (Direct Preference Optimization)

Skip le reward model. Optimise directement le modèle sur des paires de préférences avec une loss simple. Avantages :

  • Plus simple, moins de hyper-paramètres
  • Pas de reward model à entraîner
  • Pas de PPO à tuner
  • Résultats comparables ou meilleurs que RLHF

Inconvénient : moins flexible si on veut iterer sur le reward.

RLAIF (RL from AI Feedback)

Remplacer le feedback humain par un LLM puissant (ex. Claude ou GPT-4) qui classe les réponses. Beaucoup moins cher, scalable, mais introduit les biais du LLM-juge.

Constitutional AI d'Anthropic est une forme de RLAIF.

KTO (Kahneman-Tversky Optimization)

Encore plus simple : ne nécessite que des binary labels (good / bad) au lieu de paires. Utile quand on a des feedback uniques (thumbs up/down) plutôt que des comparaisons.

FAQ

Q : Reward hacking évitable ?

R : Partiellement. Mitigation : KL penalty, reward model diverse, evals adversarial. Pas d'élimination totale.

Q : Adopter DPO ou rester RLHF ?

R : DPO plus simple à démarrer. RLHF plus flexible pour réward shaping fin. Llama 3, Mistral utilisent DPO. OpenAI continue avec PPO custom.

Conclusion

RLHF 2026 reste l'épine dorsale de l'alignement LLM commercial mais les alternatives gagnent du terrain. DPO est devenu le défaut pour les modèles open source (Llama, Mistral). RLAIF / Constitutional AI domine chez Anthropic. Une équipe sérieuse en safety doit comprendre les trois et choisir selon ses contraintes (coût feedback, complexité, flexibilité).

Tags :#RLHF#AI Safety#DPO#Alignment
Partager :

Mohamed Bah

Fondateur, Kolonell

Passionné par le digital et l'entrepreneuriat en Afrique, Mohamed accompagne les entreprises sénégalaises dans leur transformation digitale depuis 2020. Fondateur de Kolonell, il croit que chaque PME mérite une présence en ligne professionnelle et accessible.