Glossar
Data

Data Lineage

Auch: Data Provenance, Lineage Tracking

Data Lineage zeigt, wie Daten sich durch Systeme bewegen und dabei transformiert werden, von der Quelle bis zur Nutzung: woher sie kommen, was sie verändert hat und wohin sie gehen.

Was es ist

Data Lineage ist die dokumentierte Karte der Daten auf ihrem Weg durch eine Organisation. Sie verfolgt jedes Datenelement von seiner Quelle (Datenbanken, APIs, Dateien, Sensoren) über jede Transformation, jeden Join, jede Aggregation und jede Kopie bis zu den Endpunkten (Dashboards, Reports, Modelle, nachgelagerte Systeme).

Lineage beantwortet Fragen wie: Woher kommt diese Zahl? Welche Logik hat sie erzeugt? Was bricht, wenn diese Tabelle sich ändert? Welche Reports hängen von dieser Spalte ab?

Lineage wird typischerweise auf zwei Ebenen erfasst:

  • Tabellen- oder Dataset-Ebene: welche Datasets in welche anderen Datasets einfließen.
  • Spalten- oder Feld-Ebene: wie einzelne Felder abgeleitet werden. Das ist präziser und für die Impact-Analyse deutlich nützlicher.

Warum es zählt

Moderne Datenlandschaften sind weitläufig und stark verknüpft, eine einzige Änderung kann sich unvorhersehbar fortpflanzen. Lineage liefert:

  • Vertrauen: Nutzer können nachvollziehen, wie eine Metrik berechnet wurde.
  • Impact-Analyse: Bevor eine Quelle geändert wird, sehen die Teams jedes betroffene nachgelagerte Asset.
  • Root-Cause-Analyse: Wenn ein Dashboard falsch aussieht, hilft Lineage, die gebrochene Verbindung upstream schnell zu finden.
  • Regulatorische Compliance: Frameworks wie GDPR, BCBS 239 und SOX verlangen den Nachweis, woher sensible oder Finanzdaten stammen und wie sie verarbeitet werden.
  • Governance: Klassifizierungen, Ownership und Qualitätsregeln können sich entlang der Lineage-Pfade fortpflanzen.

Für einen Chief Data Officer ist Lineage der grundlegende Nachweis, dass Daten governed, auditierbar und verlässlich sind.

Wie es in der Praxis genutzt wird

Lineage lässt sich erfassen über:

  • Automatisiertes Parsing von SQL, ETL-Pipelines und Orchestrierungs-Logs.
  • Metadaten-Extraktion aus Datenplattformen und Katalogen.
  • Manuelle Dokumentation für Systeme, die nicht geparst werden können (oft der schwächste und am wenigsten gepflegte Teil).

Teams nutzen sie dann für Impact Reviews, Audits, Deprecation-Planung und Onboarding.

Konkretes Beispiel

Ein Finance-Team berichtet Net Revenue auf einem Executive-Dashboard. Die Lineage zeigt, dass die Metrik aus einer `transactions`-Tabelle gebaut wird, die mit `refunds` gejoint, nach Region gefiltert und über eine Währungsumrechnungstabelle angepasst wird. Als der Währungs-Feed sein Schema ändert, markiert die Lineage sofort, dass das Net-Revenue-Tile, drei weitere Reports und ein Forecasting-Modell davon abhängen. Das Team repariert die Pipeline, bevor Stakeholder falsche Zahlen sehen, und macht aus einem potenziellen Incident eine Routineaufgabe.

Ohne Lineage könnte dieselbe Änderung Zahlen wochenlang unbemerkt verfälschen.

Data Lineage: Source to ConsumptionSource DBtransactionsAPI FeedcurrencyTransformjoin + convertDashboardNet RevenueForecast Modelconsumer
Lineage traces fields from sources through transformations to every downstream consumer.

Häufige Fragen

Was ist Data Lineage einfach erklärt?

Data Lineage ist die dokumentierte Karte der Daten auf ihrem Weg durch eine Organisation, von der Quelle (Datenbanken, APIs, Dateien, Sensoren) über jede Transformation, jeden Join, jede Aggregation und jede Kopie bis zu den Endpunkten wie Dashboards, Reports und Modelle. Sie beantwortet praktische Fragen: Woher kommt diese Zahl, welche Logik hat sie erzeugt und was bricht, wenn diese Tabelle sich ändert? Man spricht auch von Data Provenance oder Lineage Tracking.

Wer braucht Data Lineage im Unternehmen tatsächlich?

Data Lineage dient drei Gruppen: Datennutzern, die nachvollziehen müssen, wie eine Metrik berechnet wurde, Data Engineers, die den Downstream-Impact sehen müssen, bevor sie eine Quelle ändern, und Compliance- oder Audit-Teams, die belegen müssen, woher sensible und Finanzdaten stammen. Für einen Chief Data Officer ist Lineage der grundlegende Nachweis, dass Daten governed, auditierbar und verlässlich sind.

Was ist der Unterschied zwischen Lineage auf Tabellen- und auf Spaltenebene?

Lineage auf Tabellen- (oder Dataset-)Ebene zeigt, welche Datasets in welche anderen Datasets einfließen. Lineage auf Spaltenebene geht weiter und zeigt, wie jedes einzelne Feld abgeleitet wird. Die Spaltenebene ist präziser und für die Impact-Analyse deutlich nützlicher, weil sie genau sagt, welche Reports von einer bestimmten Spalte abhängen und nicht nur von einer ganzen Tabelle.

Wie wird Lineage in der Praxis erfasst?

Drei Methoden, meist kombiniert: automatisiertes Parsing von SQL, ETL-Pipelines und Orchestrierungs-Logs; Metadaten-Extraktion aus Datenplattformen und Katalogen; und manuelle Dokumentation für Systeme, die nicht geparst werden können. Der manuelle Teil ist typischerweise der schwächste und am wenigsten gepflegte, und genau dort entfernen sich Lineage-Karten von der Realität.

Gibt es ein konkretes Beispiel, bei dem Lineage einen Incident verhindert hat?

Ein Finance-Team veröffentlicht Net Revenue auf einem Executive-Dashboard, gebaut aus einer transactions-Tabelle, die mit refunds gejoint, nach Region gefiltert und über eine Währungsumrechnungstabelle angepasst wird. Als der Währungs-Feed sein Schema ändert, markiert die Lineage sofort, dass das Net-Revenue-Tile, drei weitere Reports und ein Forecasting-Modell davon abhängen. Das Team repariert die Pipeline, bevor Stakeholder falsche Zahlen sehen; ohne Lineage könnte dieselbe Änderung Zahlen wochenlang unbemerkt verfälschen.