Déployer des modèles de vision en production sur edge devices (caméras IP, drones, smartphones, robots, kiosques) est une discipline distincte du déploiement cloud. Latence, consommation, bande passante, coût hardware imposent des contraintes spécifiques.
TL;DR
- Edge = inference sur device, pas cloud.
- Hardware : Jetson Orin, Raspberry Pi 5, Coral TPU, mobile.
- Optimisations : quantization int8, pruning, distillation.
- Frameworks : TensorRT, TFLite, ONNX Runtime, OpenVINO.
Pourquoi edge vs cloud
- Latence : 10-50 ms edge vs 200-500 ms cloud (réseau aller-retour)
- Bande passante : éviter d'envoyer vidéo 4K en streaming continu vers cloud
- Privacy : données image / vidéo restent sur device (RGPD, vie privée)
- Disponibilité : fonctionne offline, sans connectivité
- Coût : pas de facture GPU cloud à chaque inference
Hardware edge populaire 2026
- NVIDIA Jetson Orin Nano (~250$) : 40 TOPS INT8, 8 GB RAM, idéal robotique / drones
- NVIDIA Jetson AGX Orin (~2000$) : 275 TOPS, vision avancée, véhicules
- Raspberry Pi 5 (~80$) : Cortex-A76, OK pour modèles légers (YOLO nano)
- Google Coral TPU (~150$) : 4 TOPS dédié ML, USB ou PCIe
- Apple Silicon (Mac, iPhone) : Neural Engine intégré 15-35 TOPS
- Qualcomm Snapdragon : Hexagon DSP pour smartphones Android
- Intel CPU + OpenVINO : pour kiosques et embedded x86
- Hailo-8 : 26 TOPS embedded, surveillance
Techniques d'optimisation
Quantization
Conversion FP32 (32-bit float) vers INT8 (8-bit int) :
- 4x moins de mémoire
- 2-4x plus rapide selon hardware
- Perte de précision typique : 1-3 %
- Post-Training Quantization (PTQ) : rapide, sans re-training
- Quantization-Aware Training (QAT) : meilleure qualité, nécessite re-training
Pruning
Supprimer les poids proches de zéro :
- Structured pruning (filtres entiers) : speedup hardware
- Unstructured pruning : moins de speedup pratique
- Magnitude pruning, lottery ticket hypothesis
Knowledge distillation
Besoin d'un site web professionnel ?
Kolonell crée des sites web qui attirent des clients, optimisés pour le marché sénégalais. Devis gratuit en 2 minutes.
Entraîner un petit modèle (student) à imiter un grand modèle (teacher) :
- Teacher : YOLOv11-xl
- Student : YOLOv11-nano
- Student apprend les "soft labels" du teacher
- Performance meilleure que student entraîné from scratch
Frameworks de déploiement
- TensorRT (NVIDIA Jetson) — optimisation aggressive, INT8 + FP16, leader performance
- TFLite (Google, mobile) — Android, iOS, Coral TPU
- ONNX Runtime — multi-platform, intermediate format universal
- CoreML (Apple) — iOS, macOS, optimisé Apple Silicon
- OpenVINO (Intel) — CPU Intel, kiosques, NUCs
- Pytorch Mobile — Pytorch direct sur device
Pipeline déploiement typique
- Entraîner modèle (Python, PyTorch / TF)
- Exporter ONNX
- Optimiser (quantization, pruning)
- Convertir vers format edge (TensorRT, TFLite, etc.)
- Benchmark sur device cible (latence, mémoire, précision)
- Itérer si métriques insuffisantes
FAQ
Q : Quel hardware edge pour démarrer ?
R : Jetson Orin Nano (~250$) couvre la plupart des cas. Coral TPU si très contraint budget.
Q : Quel speedup attendre quantization INT8 ?
R : 2-4x typique. Selon hardware : Coral TPU 4-10x (TPU optimisé INT8), CPU 1.5-2x.
Conclusion
Computer vision edge 2026 a atteint un niveau de maturité où on peut déployer YOLO, CLIP, SAM sur device avec latence et qualité acceptables. Jetson Orin Nano, Coral TPU, et l'écosystème mobile (CoreML, TFLite) couvrent 90 % des besoins production. Quantization + distillation sont les optimisations indispensables. Pour toute équipe vision, planifier le déploiement edge dès la conception du modèle est essentiel.
Mohamed Bah
Fondateur, Kolonell
Passionné par le digital et l'entrepreneuriat en Afrique, Mohamed accompagne les entreprises sénégalaises dans leur transformation digitale depuis 2020. Fondateur de Kolonell, il croit que chaque PME mérite une présence en ligne professionnelle et accessible.
