← Ressources

Joe Naso & Colton Padden — « Data Platform Fundamentals » (Dagster)

Les fondamentaux d'une plateforme data

1. Qu'est-ce qu'une Data Platform ?

Une data platform est une infrastructure centralisée et hétérogène qui fédère l'ensemble des processus data d'une organisation sous un plan de contrôle unifié. Elle ne se limite pas à un orchestrateur : elle combine orchestration, métadonnées et observabilité pour offrir une vision cohérente de tous les flux de données entrants et sortants.

L'ouvrage défend l'idée qu'une seule data platform doit exister par organisation. L'investissement initial est compensé par la standardisation, la productivité accrue et la réduction du travail dupliqué à mesure que la plateforme se développe.

Le plan de contrôle (control plane) est la pièce maîtresse : il configure et active le plan de données, connecte les assets entre systèmes et outils, et fournit la traçabilité (lineage) nécessaire pour comprendre l'impact en cascade d'un incident.

2. Architecturer sa Data Platform

Principes directeurs

Architectures de données courantes

ArchitecturePrincipeAvantagesLimites
ETL (Extract-Transform-Load)Transformation en transit avant écritureRéduit le compute côté destinationPerte de granularité des données brutes
ELT (Extract-Load-Transform)Chargement brut puis transformation dans le warehouseConservation des données brutes, flexibilité de re-traitementCoûts de stockage et de compute plus élevés
Data LakehouseÉchelle du data lake + structure du warehouse (formats Iceberg, Delta, Hudi)Traitement à grande échelle, support ACIDComplexité accrue
Event-DrivenDéclenchement par événements (Kafka, webhooks, notifications S3)Traitement quasi temps réelCoût du compute long, complexité de re-exécution

3. Design Patterns pour les pipelines

Trois patterns fondamentaux régissent la circulation des données :

Idempotence

Un pipeline idempotent produit le même résultat pour un même jeu de paramètres, quel que soit le nombre d'exécutions. Cela passe notamment par l'utilisation de fenêtres temporelles explicites (partitions) plutôt que de références relatives au moment d'exécution.

4. Modélisation des données — L'architecture Medallion

L'architecture Medallion structure les données en trois couches d'isolation :

CoucheRôle
BronzeDonnées brutes telles que reçues (landing zone), potentiellement sans schéma
SilverDonnées nettoyées, structurées, validées — couche principale de contrôle qualité
GoldDonnées prêtes pour la consommation métier : agrégats, métriques, modèles ML

Cette séparation facilite la gouvernance, la sécurité, et la résilience face aux changements de schéma des sources amont. La séparation lecture/écriture permet aussi des workflows CI/CD avancés (Blue/Green Deployments).

Composants d'une plateforme bien configurée

L'ouvrage identifie huit catégories d'outillage essentielles : orchestration, catalogage, stockage, réplication, ingestion, transformation, observabilité et versioning des données.

Fonctionnalités indispensables

Quatre fonctionnalités différencient une plateforme robuste d'une collection de scripts : le logging, les retries, le backfilling et les pipelines auto-réparants (self-healing).

5. Qualité des données

Les six dimensions de la qualité

DimensionDéfinition
TimelinessLes données sont-elles à jour par rapport aux SLA attendus ?
CompletenessTous les champs requis sont-ils renseignés ?
AccuracyLes valeurs reflètent-elles fidèlement la réalité ?
ValidityLes entrées respectent-elles le format, le schéma ou la liste de valeurs attendue ?
UniquenessPas de doublons sur les clés censées être uniques
ConsistencyAlignement des données entre systèmes source et répliques

Mise en œuvre

La qualité doit être contrôlée à chaque étape du cycle de vie de la donnée : couche applicative, réplication, couche analytique et reporting. L'orchestrateur joue un rôle central en consolidant les règles de qualité de différentes équipes et en bloquant la propagation de données défaillantes vers les consommateurs.

Outils courants : Soda, Great Expectations, Deequ, dbt tests, Dagster Asset Checks.

6. Exemples concrets de Data Platforms

ExempleSourcesWarehouseOrchestrateurIngestionTransformationReporting
Lightweight Data LakeS3, tiersSnowflakeDagsterStitch, SlingdbtHolisitics
GCP StackPostgres (Cloud SQL)BigQueryAirflow (Cloud Composer)Custom, DataStreamDataFormLooker
AWS StackRDS, DynamoDBRedshiftAirflow (MWAA)Lambda, DMSAWS GlueQuickSight
MDS classiquePostgresSnowflakeDagsterFivetran, dlt, SlingSDFLooker, Hex
Data LakehousePostgres, S3AWS Step FunctionsAWS GlueSpark, AthenaLooker
Event-DrivenSFTP, S3BigQuery— (events)Lambda, FargatedbtOmni

Points clés à retenir