Apache Spark reste l'engine compute distribué dominant pour big data en 2026. Databricks ($43B valuation, IPO retardé) pousse Spark + Delta Lake + Unity Catalog + Photon. Mais Polars (Rust) et DuckDB grignotent les use cases mid-scale.
TL;DR
- Spark : leader compute distribué big data depuis 2014.
- 2026 : Databricks Photon engine 12x plus rapide.
- Challenges : Polars (Rust), DuckDB single-node killer.
- Use cases : ETL massif, ML training, streaming.
Spark architecture
`
Driver (coordinator)
↓
Cluster Manager (YARN, Kubernetes, Standalone)
↓
Executors (workers)
↓
Tasks (units of work)
`
API typique 2026
`python
from pyspark.sql import SparkSession
from pyspark.sql.functions import col, sum, count
spark = SparkSession.builder \
.appName("sales_analysis") \
.config("spark.sql.adaptive.enabled", "true") \
.getOrCreate()
df = spark.read.parquet("s3://bucket/sales/")
result = (df
.filter(col("country") == "SN")
.groupBy("category")
.agg(
count("*").alias("nb_orders"),
sum("amount").alias("revenue")
)
.orderBy(col("revenue").desc())
)
result.write.parquet("s3://bucket/marts/senegal_sales/")
Besoin d'un site web professionnel ?
Kolonell crée des sites web qui attirent des clients, optimisés pour le marché sénégalais. Devis gratuit en 2 minutes.
`
Databricks 2026
- Photon engine : C++ rewrite, 12x faster vs JVM
- Delta Lake : ACID transactions sur object storage
- Unity Catalog : governance unified
- DBSQL : warehouse-style serverless
- MLflow integration : tracking, registry, deployment
- Mosaic AI : LLM training/serving
Pricing Databricks
- DBU (Databricks Unit) based
- Compute : $0.07-0.55/DBU selon tier
- Premium features : Photon, Serverless, AI/ML
- Africa : 100-10K$/mois startups, 100K+/mois enterprise
Alternatives 2026
Polars
- Rust DataFrame library
- 10-50x faster than Pandas single-node
- Lazy evaluation, query optimizer
- Memory-efficient
- Pas distributed (encore)
- Adoption massive 2024-2026
DuckDB
- OLAP embedded database
- "SQLite for analytics"
- Single-node mais 100GB+ ok
- Memory + disk spillover
- Adoption boom 2024-2026
Ray
- Python distributed framework
- ML training scaling
- Anyscale commercial
Dask
- Python parallel computing
- Dataframe Pandas-like distributed
- Adoption mid-tier
Snowflake Snowpark
- Compute in-warehouse
- Python/Java/Scala stored procedures
Pattern moderne 2026
Small data (< 50 GB) : DuckDB ou Polars suffisent, plus rapide que Spark setup overhead.
Medium data (50 GB - 5 TB) : Snowflake/BigQuery suffisent, dbt pour transformations.
Big data (5 TB+) : Spark / Databricks toujours pertinent.
Streaming : Spark Structured Streaming, Flink, Kafka Streams.
Use cases Africa
- Telcos : CDR processing 100s TB/jour
- Banking : transactions historiques, fraud detection
- Mobile money : reconciliation massive
- Satellite imagery : Earth observation Africa
- Healthcare : population genomics
FAQ
Q : Spark obsolète ?
R : Non, mais surutilisé. 80 % use cases peuvent maintenant DuckDB/Polars + warehouse moderne. Spark reste roi big data 5 TB+.
Q : Databricks vs Snowflake ?
R : Databricks meilleur ML + data engineering. Snowflake meilleur warehouse + BI. Convergence 2024-2026 brouille les cartes.
Conclusion
Spark 2026 : leader compute distribué big data, Databricks pousse innovations (Photon, Delta, Mosaic AI). Mais Polars / DuckDB killent les use cases mid-scale. Pour startups Africa, commencer DuckDB/Polars + warehouse, monter à Spark seulement si TB+ sustained.
Mohamed Bah
Fondateur, Kolonell
Passionné par le digital et l'entrepreneuriat en Afrique, Mohamed accompagne les entreprises sénégalaises dans leur transformation digitale depuis 2020. Fondateur de Kolonell, il croit que chaque PME mérite une présence en ligne professionnelle et accessible.
