CLIP (Contrastive Language-Image Pre-training), publié par OpenAI en 2021, est en 2026 le fondement de nombreuses applications vision-langage : zero-shot classification, search d'images, modération de contenu, et l'embedding backbone de DALL-E et Stable Diffusion.
TL;DR
- CLIP aligne images et texte dans un même espace vectoriel.
- Zero-shot classification sans dataset spécifique.
- Embedding pour search d'images sémantique.
- Variantes : OpenCLIP, SigLIP (Google), EVA-CLIP.
Comment CLIP fonctionne
CLIP entraîne deux encoders en parallèle :
- Image encoder : ViT (Vision Transformer) ou ResNet
- Text encoder : Transformer (architecture similaire à GPT)
Sur un dataset de 400M paires (image, légende) scrapées du web, CLIP maximise la similarité cosinus entre l'embedding de l'image et celui de sa légende, tout en minimisant la similarité avec les autres légendes du batch. Ce contraste pousse les deux encoders à apprendre un espace partagé où images et textes correspondants sont proches.
Zero-shot classification
Application phare : classifier sans dataset spécifique. Pour reconnaître "chat", "chien", "voiture" sur une image :
- Encoder l'image avec l'image encoder
- Encoder les phrases "une photo de chat", "une photo de chien", "une photo de voiture"
- Calculer la similarité cosinus
- Retourner la classe avec la plus haute similarité
Pas besoin d'entraînement spécifique. Performance souvent comparable à des modèles fine-tunés.
Use cases production
- Search d'images sémantique : indexer des photos par leur embedding CLIP, requête textuelle "femme en robe rouge sur la plage"
- Modération de contenu : détecter violence, nudité, contenus problématiques par prompts textuels
- DALL-E / Stable Diffusion guidance : utiliser CLIP score pour guider la génération
- Image deduplication : trouver images similaires par embedding
- Captioning training data : générer automatiquement des données d'entraînement
Besoin d'un site web professionnel ?
Kolonell crée des sites web qui attirent des clients, optimisés pour le marché sénégalais. Devis gratuit en 2 minutes.
Variantes 2024-2026
- OpenCLIP (LAION) — re-entraîné open source sur LAION-5B
- SigLIP (Google) — loss sigmoid au lieu de softmax, plus efficace
- EVA-CLIP — meilleure architecture, scaling up
- MetaCLIP (Meta) — data curation method, mêmes performances avec moins de données
- DFN-2B (Apple) — Data Filtering Networks
Tailles modèles
- ViT-B/32 : ~150 MB, vitesse, qualité moyenne
- ViT-L/14 : ~430 MB, équilibré
- ViT-H/14 : ~1.5 GB, qualité haute
- ViT-bigG : ~2.5 GB, top qualité (utilisé par Stable Diffusion XL)
FAQ
Q : CLIP vs un classifier fine-tuné ?
R : Fine-tuné > CLIP zero-shot sur un domaine spécifique. CLIP > fine-tuné sur flexibility (n'importe quelle classe à la volée).
Q : Self-host CLIP coûteux ?
R : Non. ViT-B/32 tourne sur CPU. ViT-L sur GPU mid (T4, 4090). Inference 10-100 images/sec.
Conclusion
CLIP 2026 est devenu l'infrastructure invisible de nombreuses applications. Zero-shot classification, search sémantique, modération, génération guidée — tous reposent sur ce simple principe : aligner images et texte dans un espace partagé. Pour une équipe vision en production, comprendre et déployer CLIP (ou OpenCLIP, SigLIP) est devenu incontournable.
Mohamed Bah
Fondateur, Kolonell
Passionné par le digital et l'entrepreneuriat en Afrique, Mohamed accompagne les entreprises sénégalaises dans leur transformation digitale depuis 2020. Fondateur de Kolonell, il croit que chaque PME mérite une présence en ligne professionnelle et accessible.
