+55 XP

Data Pipelines: ETL/ELT, Batch, Streaming und Medallion-Architektur

Data Pipelines sind das Kreislaufsystem Ihrer Datenplattform. Sie transportieren Daten von dort, wo sie entstehen, dorthin, wo sie genutzt werden. Wenn sie funktionieren, merkt es niemand. Wenn sie ausfallen, steht alles still.

Ein CDO, der die Architektur von Data Pipelines nicht versteht, kann Ausfälle nicht diagnostizieren, keine glaubwürdigen Gespräche mit Engineering-Teams führen und keine guten Architekturentscheidungen treffen.

ETL vs. ELT: der grundlegende Musterwechsel

Klassisches ETL (Extract, Transform, Load) transformiert Daten, bevor sie ins Ziel geladen werden. ELT (Extract, Load, Transform) lädt zuerst die Rohdaten und transformiert sie dann im Zielsystem.

ETL war sinnvoll, als Compute teuer und Storage günstig war: Man minimierte, was man speicherte. ELT ist sinnvoll, wenn Cloud-Warehouses (Snowflake, BigQuery) skalierbares Compute bieten und man Rohdaten für eine flexible Weiterverwendung erhalten will.

Moderner Default: ELT. Rohdaten in Ihr Warehouse oder Ihren Lake laden. Transformation über SQL (dbt) oder Spark. Bei veränderten Anforderungen erneut transformieren, ohne die Quelldaten neu zu laden.

ETL vs ELT: Key Differences Explained

Watch on YouTube

Wissenscheck

1. Was ist der grundlegende Unterschied zwischen ETL und ELT?

2. Warum ist ELT gegenüber klassischem ETL zum modernen Default geworden?

3. Ein Fraud-Detection-System muss auf Transaktionen reagieren, während sie passieren. Welches Verarbeitungsmuster ist am geeignetsten?

MEHRFACHAUSWAHL

4. Wählen Sie ALLE korrekten Aussagen zu Batch, Streaming und Micro-Batch.

Wählen Sie alle richtigen Antworten aus.

MEHRFACHAUSWAHL

5. Wählen Sie ALLE korrekten Aussagen zu Pipeline-Orchestrierung und Apache Airflow.

Wählen Sie alle richtigen Antworten aus.

Batch vs. Streaming: das Latenzspektrum

Batch Processing bewegt Daten in geplanten Fenstern: stündlich, täglich, wöchentlich. Tools: Apache Spark, dbt, AWS Glue. Einsatz, wenn: Latenz akzeptabel ist (Reports über Nacht, wöchentliche Modelle), das Datenvolumen hoch und die Verarbeitung komplex ist.

Streaming Processing bewegt Daten in Echtzeit oder nahezu in Echtzeit (Sekunden bis Minuten). Tools: Apache Kafka, Apache Flink, AWS Kinesis, Google Pub/Sub. Einsatz, wenn: Geschäftsentscheidungen von aktuellen Daten abhängen (Fraud Detection, Echtzeit-Personalisierung, operative Dashboards).

Micro-Batch ist der Mittelweg: kleine Batches, die alle paar Minuten verarbeitet werden. Apache Spark Structured Streaming unterstützt das. Oft ausreichend, wenn echte Echtzeit nicht nötig ist, stündliche Batches aber zu langsam sind.

Die meisten Organisationen brauchen beides: Batch für schwere analytische Workloads, Streaming für operative Use Cases. Bauen Sie die Architektur so, dass sie beide Muster unterstützt, und nicht getrennte, inkompatible Systeme für jedes.

Pipeline-Orchestrierung

Orchestrierung beantwortet die Frage: Wer entscheidet, wann Pipelines laufen, in welcher Reihenfolge, und was passiert, wenn sie fehlschlagen?

Apache Airflow ist der dominierende Open-Source-Orchestrator. Pipelines werden als DAGs (Directed Acyclic Graphs) in Python definiert. Starkes Ökosystem, ausgereiftes Monitoring, komplex im Betrieb.

Prefect und Dagster sind moderne Alternativen mit besserer Developer Experience und nativer Unterstützung datenspezifischer Muster (Asset Materialization, Data Lineage).

dbt Cloud übernimmt die Orchestrierung speziell für Transformations-Workloads.

Im Maßstab wird die Komplexität der Orchestrierung zu einer erheblichen operativen Last. Airbnb betreibt täglich tausende Airflow-DAGs; DAG-Sprawl, Dependency-Management und Failure Recovery zu managen ist eine eigene Engineering-Funktion. CDOs sollten diese Kosten einplanen, wenn sie Headcount im Data Engineering festlegen.

Zuverlässigkeit von Data Pipelines

Pipeline-Zuverlässigkeit ist ein Thema erster Ordnung. Eine Pipeline, die stillschweigend falsche Ergebnisse produziert, ist schlimmer als eine, die laut scheitert. Zentrale Praktiken:

  • Idempotenz: Eine Pipeline zweimal auszuführen sollte dasselbe Ergebnis liefern. Vermeiden Sie Append-only-Writes ohne Deduplizierung.
  • Datenqualitätsprüfungen in jeder Stufe: Warten Sie mit der Validierung nicht bis zum Schluss, prüfen Sie bei der Ingestion, bei der Transformation, beim Laden.
  • Alerting auf Qualität, nicht nur auf Fehler: Eine Pipeline, die läuft, aber 40 % Null-Werte produziert, ist gescheitert. Überwachen Sie Completeness, Freshness und Schema Drift, nicht nur den Job-Status.
  • Lineage-Dokumentation: Wissen Sie, welche Downstream-Consumer von jeder Pipeline abhängen. Wenn sich eine Pipeline ändert, informieren Sie die Downstream-Teams proaktiv.

Architektur in der Praxis: das Medallion-Muster

Die Medallion-Architektur (Bronze → Silver → Gold) hat sich zum De-facto-Standard für Lake- und Lakehouse-Implementierungen entwickelt:

  • Bronze: Rohe, unveränderte Daten aus der Ingestion, mit Metadaten (Load-Timestamp, Quellsystem). Niemals löschen. Das ist Ihr Audit Trail.
  • Silver: Bereinigte, deduplizierte, standardisierte Daten. Joins angewendet. Business Rules teilweise durchgesetzt. Geeignet für Data-Science-Exploration.
  • Gold: Aggregierte, geschäftsfertige Daten. Optimiert für bestimmte analytische Use Cases. Genutzt von BI-Tools und Business-Stakeholdern.

Uber, Netflix und Databricks-Kunden nutzen dieses Muster breit. Es schafft klare Erwartungen an die Datenqualität in jeder Schicht und macht das Debugging schneller: Wenn eine Geschäftsmetrik falsch ist, wissen Sie, welche Schicht Sie zuerst untersuchen müssen.

Quizfragen

1. Warum ist ELT zum modernen Default-Pattern geworden?

A) Es ist schneller als ETL

B) Cloud-Warehouses bieten skalierbares Compute, sodass Rohdaten erhalten bleiben und bei Bedarf neu transformiert werden können

C) Es erfordert weniger technische Kompetenzen

D) Es senkt die Storage-Kosten

Antwort: B

2. Was enthält in der Medallion-Architektur die Bronze-Schicht?

A) Aggregierte, für BI optimierte Daten

B) Bereinigte und standardisierte Daten

C) Rohe, unveränderte Daten mit Load-Metadaten

D) Produktionsdaten in Echtzeit

Antwort: C

3. Was ist der zentrale Unterschied zwischen Streaming und Micro-Batch?

A) Micro-Batch ist immer langsamer als Batch

B) Streaming verarbeitet jedes Event einzeln in Echtzeit, Micro-Batch verarbeitet kleine Lots alle paar Minuten

C) Micro-Batch ist identisch mit Streaming

D) Streaming funktioniert nur mit Kafka

Antwort: B

Was Sie aus dieser Lektion umsetzen

Diese Maßnahmen sind im Playbook der Rolle zusammengefasst.

  • Pipelines auf das Medallion-Muster mit Bronze-, Silver- und Gold-Layer standardisieren
Vollständiges Action Playbook ansehen

Verwandte Artikel

Aktuelle Blogartikel, die auf dieser Lektion aufbauen.