+45 XP

Data lineage & Metadata-Management: wissen, wo Ihre Daten geboren wurden

Sie können die beste Analytics-Infrastruktur der Welt haben und trotzdem nicht wissen, ob Sie Ihren Daten trauen können. Data lineage schließt diese Lücke.

Warum Data lineage zählt

Regulatorische Compliance: Finanzaufsichtsbehörden (BCBS 239, Basel III, MiFID II) verlangen von Banken den Nachweis, dass ihre Risikodaten von der Quelle bis zum Report nachvollziehbar sind. Wenn Sie nicht zeigen können, woher eine Zahl kommt, jede Transformation, jeder Join, jede Aggregation, fallen Sie im Audit durch. BCBS-239-Compliance ohne Data lineage ist buchstäblich unmöglich.

Vertrauen im Business: Wenn die Umsatzzahl des CFO nicht zur Umsatzzahl des CMO passt, muss jemand erklären, warum. Ohne Data lineage dauert diese Untersuchung Wochen manueller Forensik. Mit lineage dauert sie Minuten. Data lineage ist die Grundlage von Datenvertrauen.

Impact-Analyse: Wenn Sie das Schema eines Quellsystems ändern müssen, müssen Sie wissen, welche nachgelagerten Reports und Modelle kaputtgehen. Ohne lineage nehmen Sie die Änderung vor und entdecken den Schaden in der Produktion. Mit lineage sehen Sie die Auswirkung, bevor Sie irgendetwas anfassen.

Debugging: Wenn ein Dashboard eine Zahl zeigt, die falsch aussieht, können Sie mit lineage genau nachvollziehen, welche Transformation den Fehler eingeführt hat. Ohne lineage durchsuchen Sie Dutzende Pipelines in der Hoffnung, den Bug zu finden.

Technical lineage vs. business lineage

Technical lineage verfolgt den Datenfluss auf Systemebene: Tabelle A → SQL-Transformation → Tabelle B → ETL-Job → Data Warehouse → Report. Sie wird von modernen Tools automatisch erzeugt und ist vor allem für Engineers und Architekten nützlich.

Business lineage übersetzt technical lineage in Business-Sprache: „Die Umsatzzahl im Dashboard des CFO stammt aus Transaktionsdaten im ERP, korrigiert um die Retourenverarbeitung, und schließt Intercompany-Transaktionen gemäß Policy FIN-047 aus.“ Das ist, was Führungskräfte und Prüfer tatsächlich brauchen.

Die Herausforderung für den CDO: technical lineage wird automatisch erzeugt (Tools wie Collibra, Alation oder OpenLineage erfassen sie aus Ihren Pipelines). Business lineage braucht menschliche Kuratierung, jemand, der sowohl den Geschäftsprozess als auch die technische Umsetzung versteht, muss sie schreiben. Das ist typischerweise der Data Steward.

Data Lineage & Metadata Management Complete Guide

Watch on YouTube

Wissenscheck

1. Was ist der grundlegende Zweck von Data lineage?

2. Was ist der wesentliche Unterschied zwischen technical lineage und business lineage?

3. Warum gilt Data lineage als unverzichtbar für die Impact-Analyse?

MEHRFACHAUSWAHL

4. Wählen Sie ALLE in der Lektion genannten Gründe, warum Data lineage zählt.

Wählen Sie alle richtigen Antworten aus.

MEHRFACHAUSWAHL

5. Wählen Sie ALLE Aussagen, die business lineage korrekt beschreiben.

Wählen Sie alle richtigen Antworten aus.

Metadaten: die Taxonomie

Metadaten werden oft als „Daten über Daten“ beschrieben. Das ist technisch korrekt, aber unbrauchbar abstrakt. In der Praxis sind Metadaten der Kontext, der Daten nutzbar macht:

Technische Metadaten: Schema-Definitionen, Datentypen, Tabellenbeziehungen, API-Contracts, Aktualisierungsfrequenzen. Automatisch von Ihren Datenplattformen erfasst.

Business-Metadaten: Fachliche Definitionen („Kunde“ bedeutet eine Person, die mindestens einen Kauf getätigt hat, ohne Trial-Nutzer und Mitarbeitende), fachliche Owner, Datenqualitätsregeln, Sensitivitätsklassifizierung.

Operative Metadaten: Datenaktualität, Zeitstempel der letzten Aktualisierung, Historie der Pipeline-Läufe, Trends im Datenvolumen. Entscheidend für das Monitoring der Datengesundheit.

Soziale Metadaten: Wer nutzt dieses Dataset? Wie oft wurde dieses Dashboard aufgerufen? Welche Daten-Assets werden am häufigsten abgefragt? Wer hat diese Daten als vertrauenswürdig freigegeben? Zunehmend wichtig, um die Nutzung gut governter Daten voranzutreiben.

Der Data Catalog: das Google Ihrer Organisation

Ein Data Catalog ist die Oberfläche, die lineage und Metadaten nutzbar macht. Denken Sie an Google für Ihre internen Daten: Sie suchen nach „Kundenumsatz“, der Katalog zeigt die relevanten Tabellen, Dashboards und Reports, wer sie besitzt, wie frisch sie sind, was sie bedeuten und woher sie kommen.

Ohne Katalog verschwenden Datenteams enorm viel Zeit mit der Antwort auf „Wo sind die Daten, die ich brauche, und kann ich ihnen trauen?“ Mit Katalog dauern diese Fragen Sekunden.

Tool-Vergleich:

  • Collibra: Enterprise-Niveau, starke Governance-Workflows, teuer, erfordert erheblichen Implementierungsaufwand. Am besten für große regulierte Branchen.
  • Alation: Stark bei Discovery und Usage-Analytics, active metadata. Verbreitet im Mid-Market und bei Tech-Unternehmen.
  • DataHub (Open Source von LinkedIn): Kostenlos, hochgradig anpassbar, starke lineage. Erfordert Engineering-Aufwand im Betrieb.
  • Atlan: Modern Stack, starke Integrationen, kollaborative Funktionen. Wächst schnell bei Data-Mesh-Organisationen.

Das Tool ist sekundär. Die Adoption ist die eigentliche Herausforderung. Ein Data Catalog, den niemand nutzt, ist Requisite im Governance-Theater. Bauen Sie Adoption über Integration (den Katalog in Slack, in BI-Tools, in der Data-Warehouse-UI sichtbar machen), Kuratierung (dafür sorgen, dass die meistgenutzten Assets zuerst gut dokumentiert sind) und Anerkennung (Teams belohnen, die hochwertige Metadaten beitragen).

Was Sie aus dieser Lektion umsetzen

Diese Maßnahmen sind im Playbook der Rolle zusammengefasst.

  • Einen Data Catalog einführen, der in bestehende Workflows eingebettet ist, und zuerst die meistgenutzten Assets dokumentieren
Vollständiges Action Playbook ansehen

Verwandte Artikel

Aktuelle Blogartikel, die auf dieser Lektion aufbauen.