Constitutional AI (CAI) est l'approche d'alignement développée par Anthropic pour Claude. Elle remplace la dépendance massive au feedback humain de RLHF par un ensemble de principes écrits ("la constitution") et l'auto-critique du modèle.
TL;DR
- Constitution = ensemble de principes en langage naturel.
- Le modèle critique et révise ses réponses contre la constitution.
- Beaucoup moins de feedback humain coûteux nécessaire.
- Principes explicites et auditables (vs RLHF opaque).
Le problème que CAI résout
RLHF demande des millions de comparaisons humaines, ce qui :
- Coûte 1-10M$ par modèle pour le feedback
- Encode les biais inconscients des labelers
- N'est pas auditables (qu'est-ce que le modèle a appris exactement ?)
- Ne scale pas à mesure que les modèles deviennent plus capables
Constitutional AI inverse l'approche : on écrit explicitement ce qu'on veut, puis on laisse le modèle se corriger.
Pipeline Constitutional AI
Phase 1 : Self-critique
Le modèle génère une réponse. Puis on lui demande de critiquer sa propre réponse selon un principe constitutionnel ("Cette réponse est-elle utile ? Honnête ? Inoffensive ?"). Le modèle révise.
Phase 2 : RLAIF (RL from AI Feedback)
Au lieu de feedback humain, on utilise le modèle lui-même (ou un modèle plus capable) comme juge. Pour chaque prompt, on génère deux réponses, on demande au modèle-juge de choisir la meilleure selon la constitution.
Phase 3 : RL optimisation
Standard RL (PPO ou DPO) sur les préférences générées par AI plutôt que par humains.
La constitution Claude
Anthropic a publié la constitution utilisée pour Claude. Elle puise dans :
- Universal Declaration of Human Rights (ONU)
- Apple Terms of Service (sécurité utilisateur)
- DeepMind's Sparrow principles
- Sources Anthropic (recherche interne)
Besoin d'un site web professionnel ?
Kolonell crée des sites web qui attirent des clients, optimisés pour le marché sénégalais. Devis gratuit en 2 minutes.
Exemples de principes :
- "Choisis la réponse qui serait la plus utile, honnête et inoffensive"
- "Évite de donner des conseils qui causeraient probablement un préjudice à l'utilisateur"
- "Évite de prétendre avoir une expérience émotionnelle ou physique"
- "Refuse poliment d'aider à des activités illégales"
Avantages vs RLHF
| Critère | RLHF | Constitutional AI |
|---|---|---|
| Coût feedback | Élevé (humain) | Faible (AI) |
| Auditabilité | Opaque | Principes lisibles |
| Mise à jour | Re-labeling massif | Édition constitution |
| Biais labelers | Implicite | Explicite (visibles) |
| Scalabilité | Limitée | Scale avec compute |
Limites de Constitutional AI
- Si la constitution est mal écrite, le modèle apprend de mauvais principes
- Le modèle-juge a ses propres biais qu'il peut amplifier
- "Constitution gaming" : le modèle peut apprendre à passer les checks de la constitution sans vraiment l'incarner
- Encore besoin d'un peu de feedback humain pour calibrer
Adoption industrielle
- Anthropic : Claude 1, 2, 3, 4 utilisent CAI
- OpenAI : "Spec" approach (similaire mais propre) pour GPT-4o
- Google DeepMind : Sparrow principles, évolution interne
- Meta : Llama Guard utilise principes pour filtering
FAQ
Q : CAI rend RLHF obsolète ?
R : Non. CAI réduit le besoin de feedback humain pour le bulk mais le human feedback reste utile pour calibrer la constitution et trancher des cas ambigus.
Q : Puis-je écrire ma propre constitution ?
R : Oui. Anthropic et OpenAI exposent des APIs (system prompts, custom instructions) qui sont une forme de constitution applicative.
Conclusion
Constitutional AI 2026 est devenue une approche majeure de l'alignement, surtout chez Anthropic. Pour une équipe qui déploie des LLMs en production, comprendre CAI permet : d'écrire de meilleurs system prompts (mini-constitutions), d'auditer le comportement attendu, et de proposer des fine-tunings explicites plutôt que des RLHF opaques.
Mohamed Bah
Fondateur, Kolonell
Passionné par le digital et l'entrepreneuriat en Afrique, Mohamed accompagne les entreprises sénégalaises dans leur transformation digitale depuis 2020. Fondateur de Kolonell, il croit que chaque PME mérite une présence en ligne professionnelle et accessible.