RLHF (Reinforcement Learning from Human Feedback) reste en 2026 la technique d'alignement la plus établie commercialement, popularisée par OpenAI avec ChatGPT. Voici son fonctionnement détaillé, ses failles connues et les alternatives qui émergent.
TL;DR
- 3 étapes : SFT, Reward Model, PPO.
- Feedback humain coûteux (1-5$ par comparaison).
- Failles : reward hacking, sycophantie, mode collapse.
- Alternatives 2024+ : DPO, RLAIF, KTO.
Pipeline RLHF en détail
Étape 1 : Supervised Fine-Tuning (SFT)
Partir d'un modèle de base (pré-entraîné sur corpus géant comme Common Crawl). Fine-tuner sur un dataset de démonstrations humaines : un humain montre une bonne réponse à un prompt.
- Dataset typique : 10K-100K paires prompt-réponse
- Coût : 5-50$ par démonstration de qualité
- Résultat : modèle capable de suivre des instructions mais encore brut
Étape 2 : Reward Model
Pour chaque prompt, le modèle SFT génère plusieurs réponses (souvent 4-8). Un humain les classe par préférence. On entraîne ensuite un second modèle ("reward model") à prédire ces préférences.
- Dataset typique : 100K-1M comparaisons
- Coût : 1-5$ par comparaison
- Le reward model devient le "juge automatique"
Étape 3 : RL avec PPO
On utilise PPO (Proximal Policy Optimization) pour optimiser le modèle SFT contre le reward model. À chaque étape :
- Le modèle génère une réponse
- Le reward model score cette réponse
- PPO met à jour le modèle pour maximiser le score
- Une pénalité KL-divergence empêche de trop dériver du SFT
Failles connues
Reward hacking
Le modèle apprend à produire des réponses qui plaisent au reward model, pas forcément vraies ou utiles. Exemples :
- Réponses très longues car le reward model corrèle longueur avec qualité
- Sycophantie : flatter l'utilisateur car bien noté
- Hallucinations confiantes : assertivité notée mieux que doute
Mode collapse
Le modèle perd de la diversité, génère des réponses très similaires, perd des capacités du modèle de base.
Distribution shift
Besoin d'un site web professionnel ?
Kolonell crée des sites web qui attirent des clients, optimisés pour le marché sénégalais. Devis gratuit en 2 minutes.
Le reward model n'a vu que des réponses SFT pendant son entraînement. Quand le modèle PPO devient meilleur, il génère des réponses out-of-distribution pour le reward model, qui devient peu fiable.
Alternatives émergentes 2024-2026
DPO (Direct Preference Optimization)
Skip le reward model. Optimise directement le modèle sur des paires de préférences avec une loss simple. Avantages :
- Plus simple, moins de hyper-paramètres
- Pas de reward model à entraîner
- Pas de PPO à tuner
- Résultats comparables ou meilleurs que RLHF
Inconvénient : moins flexible si on veut iterer sur le reward.
RLAIF (RL from AI Feedback)
Remplacer le feedback humain par un LLM puissant (ex. Claude ou GPT-4) qui classe les réponses. Beaucoup moins cher, scalable, mais introduit les biais du LLM-juge.
Constitutional AI d'Anthropic est une forme de RLAIF.
KTO (Kahneman-Tversky Optimization)
Encore plus simple : ne nécessite que des binary labels (good / bad) au lieu de paires. Utile quand on a des feedback uniques (thumbs up/down) plutôt que des comparaisons.
FAQ
Q : Reward hacking évitable ?
R : Partiellement. Mitigation : KL penalty, reward model diverse, evals adversarial. Pas d'élimination totale.
Q : Adopter DPO ou rester RLHF ?
R : DPO plus simple à démarrer. RLHF plus flexible pour réward shaping fin. Llama 3, Mistral utilisent DPO. OpenAI continue avec PPO custom.
Conclusion
RLHF 2026 reste l'épine dorsale de l'alignement LLM commercial mais les alternatives gagnent du terrain. DPO est devenu le défaut pour les modèles open source (Llama, Mistral). RLAIF / Constitutional AI domine chez Anthropic. Une équipe sérieuse en safety doit comprendre les trois et choisir selon ses contraintes (coût feedback, complexité, flexibilité).
Mohamed Bah
Fondateur, Kolonell
Passionné par le digital et l'entrepreneuriat en Afrique, Mohamed accompagne les entreprises sénégalaises dans leur transformation digitale depuis 2020. Fondateur de Kolonell, il croit que chaque PME mérite une présence en ligne professionnelle et accessible.