Data Lineage
Aussi : Data Provenance, Lineage Tracking
Le data lineage cartographie les déplacements et transformations de la donnée à travers les systèmes, de l'origine à la consommation : d'où elle vient, ce qui l'a modifiée, et où elle va.
De quoi s'agit-il
Le data lineage est la cartographie documentée de la donnée telle qu'elle circule dans une organisation. Il retrace chaque élément depuis sa source (bases de données, API, fichiers, capteurs) à travers chaque transformation, jointure, agrégation et copie, jusqu'à ses destinations finales (dashboards, rapports, modèles, systèmes en aval).
Le lineage répond à des questions comme : d'où vient ce chiffre ? Quelle logique l'a produit ? Qu'est-ce qui casse si cette table change ? Quels rapports dépendent de cette colonne ?
Le lineage se capture généralement à deux niveaux :
- Niveau table ou dataset : quels datasets alimentent quels autres datasets.
- Niveau colonne ou champ : comment chaque champ est dérivé, ce qui est plus précis et plus utile pour l'analyse d'impact.
Pourquoi c'est important
Les patrimoines de données actuels sont étendus et interconnectés : un seul changement peut se propager de façon imprévisible. Le lineage apporte :
- La confiance : les consommateurs peuvent vérifier comment une métrique a été calculée.
- L'analyse d'impact : avant de modifier une source, les équipes voient tous les assets en aval concernés.
- L'analyse des causes racines : quand un dashboard semble faux, le lineage aide à remonter rapidement au maillon cassé.
- La conformité réglementaire : des cadres comme le RGPD, BCBS 239 et SOX exigent de prouver l'origine des données sensibles ou financières et la façon dont elles sont traitées.
- La gouvernance : classifications, ownership et règles de qualité peuvent se propager le long des chemins de lineage.
Pour un Chief Data Officer, le lineage est la preuve fondamentale que la donnée est gouvernée, auditable et fiable.
Comment on l'utilise en pratique
Le lineage peut être capturé via :
- Le parsing automatisé du SQL, des pipelines ETL et des logs d'orchestration.
- L'extraction de métadonnées depuis les plateformes de données et les catalogues.
- La documentation manuelle pour les systèmes qui ne peuvent pas être parsés (souvent la partie la plus faible et la moins maintenue).
Les équipes s'en servent ensuite pour les revues d'impact, les audits, la planification des dépréciations et l'onboarding.
Exemple concret
Une équipe finance publie le Net Revenue sur un dashboard de direction. Le lineage montre que la métrique est construite à partir d'une table `transactions` jointe à `refunds`, filtrée par région, et ajustée par une table de conversion de devises. Quand le flux de devises change de schéma, le lineage signale immédiatement que la tuile Net Revenue, trois autres rapports et un modèle de prévision en dépendent. L'équipe corrige le pipeline avant que les parties prenantes ne voient des chiffres erronés, transformant un incident potentiel en tâche de maintenance de routine.
Sans lineage, ce même changement pourrait corrompre silencieusement les chiffres pendant des semaines avant que quiconque ne s'en aperçoive.
Voir aussi
Questions fréquentes
Qu'est-ce que le data lineage, en clair ?
Le data lineage est la cartographie documentée du parcours des données dans l'organisation : de la source (bases, API, fichiers, capteurs) jusqu'aux destinations finales (dashboards, rapports, modèles), en passant par chaque transformation, jointure, agrégation et copie. Il répond à des questions concrètes : d'où vient ce chiffre, quelle logique l'a produit, et qu'est-ce qui casse si cette table change. On parle aussi de data provenance ou de lineage tracking.
Qui a réellement besoin du data lineage dans une entreprise ?
Le data lineage sert trois publics : les consommateurs de données qui veulent vérifier comment un indicateur a été calculé, les data engineers qui doivent mesurer l'impact en aval avant de modifier une source, et les équipes conformité ou audit qui doivent prouver l'origine des données sensibles et financières. Pour un Chief Data Officer, le lineage est la preuve de base que les données sont gouvernées, auditables et fiables.
Quelle différence entre un lineage au niveau table et au niveau colonne ?
Le lineage au niveau table (ou dataset) montre quels jeux de données alimentent quels autres. Le lineage au niveau colonne descend d'un cran et montre comment chaque champ est dérivé. Le niveau colonne est plus précis et bien plus utile pour l'analyse d'impact, puisqu'il indique exactement quels rapports dépendent d'une colonne donnée et non d'une table entière.
Comment le lineage est-il capté en pratique ?
Trois méthodes, généralement combinées : le parsing automatisé du SQL, des pipelines ETL et des logs d'orchestration ; l'extraction de métadonnées depuis les plateformes de données et les catalogues ; et la documentation manuelle pour les systèmes qu'on ne peut pas parser. C'est cette dernière partie qui est la plus faible et la moins maintenue, et c'est là que la carte s'éloigne de la réalité.
Un exemple concret de lineage qui évite un incident ?
Une équipe finance publie un Net Revenue sur un dashboard de direction, construit à partir d'une table transactions jointe aux refunds, filtrée par région et ajustée par une table de conversion de devises. Quand le flux de devises change de schéma, le lineage signale aussitôt que la tuile Net Revenue, trois autres rapports et un modèle de prévision en dépendent. L'équipe corrige le pipeline avant que les destinataires ne voient de faux chiffres ; sans lineage, le même changement pourrait fausser les chiffres pendant des semaines sans que personne ne le remarque.