Data Pipelines: ETL/ELT, Batch, Streaming und Medallion-Architektur
Data Pipelines sind das Kreislaufsystem Ihrer Datenplattform. Sie transportieren Daten von dort, wo sie entstehen, dorthin, wo sie genutzt werden. Wenn sie funktionieren, merkt es niemand. Wenn sie ausfallen, steht alles still.
Ein CDO, der die Architektur von Data Pipelines nicht versteht, kann Ausfälle nicht diagnostizieren, keine glaubwürdigen Gespräche mit Engineering-Teams führen und keine guten Architekturentscheidungen treffen.
ETLETLETL (Extract, Transform, Load) is a data integration process that pulls data from sources, reshapes it into a consistent format, and writes it into a target system.Vollständige Definition ansehen → vs. ELTELTELT (Extract, Load, Transform) is a data integration pattern where raw data is loaded into a target system first, then transformed inside it using the platform's compute power.Vollständige Definition ansehen →: der grundlegende Musterwechsel
Klassisches ETLETLETL (Extract, Transform, Load) is a data integration process that pulls data from sources, reshapes it into a consistent format, and writes it into a target system.Vollständige Definition ansehen → (Extract, Transform, LoadExtract, Transform, LoadETL (Extract, Transform, Load) is a data integration process that pulls data from sources, reshapes it into a consistent format, and writes it into a target system.Vollständige Definition ansehen →) transformiert Daten, bevor sie ins Ziel geladen werden. ELTELTELT (Extract, Load, Transform) is a data integration pattern where raw data is loaded into a target system first, then transformed inside it using the platform's compute power.Vollständige Definition ansehen → (Extract, Load, TransformExtract, Load, TransformELT (Extract, Load, Transform) is a data integration pattern where raw data is loaded into a target system first, then transformed inside it using the platform's compute power.Vollständige Definition ansehen →) lädt zuerst die Rohdaten und transformiert sie dann im Zielsystem.
ETLETLETL (Extract, Transform, Load) is a data integration process that pulls data from sources, reshapes it into a consistent format, and writes it into a target system.Vollständige Definition ansehen → war sinnvoll, als Compute teuer und Storage günstig war: Man minimierte, was man speicherte. ELTELTELT (Extract, Load, Transform) is a data integration pattern where raw data is loaded into a target system first, then transformed inside it using the platform's compute power.Vollständige Definition ansehen → ist sinnvoll, wenn Cloud-Warehouses (Snowflake, BigQuery) skalierbares Compute bieten und man Rohdaten für eine flexible Weiterverwendung erhalten will.
Moderner Default: ELT. Rohdaten in Ihr Warehouse oder Ihren Lake laden. Transformation über SQLSQLSales Qualified Lead: a prospect the sales team has validated as ready for direct outreach and a proposal, having passed clear qualification criteria.Vollständige Definition ansehen → (dbt) oder Spark. Bei veränderten Anforderungen erneut transformieren, ohne die Quelldaten neu zu laden.
ETL vs ELT: Key Differences Explained
Wissenscheck
1. Was ist der grundlegende Unterschied zwischen ETL und ELT?
2. Warum ist ELT gegenüber klassischem ETL zum modernen Default geworden?
3. Ein Fraud-Detection-System muss auf Transaktionen reagieren, während sie passieren. Welches Verarbeitungsmuster ist am geeignetsten?
4. Wählen Sie ALLE korrekten Aussagen zu Batch, Streaming und Micro-Batch.
Wählen Sie alle richtigen Antworten aus.
5. Wählen Sie ALLE korrekten Aussagen zu Pipeline-Orchestrierung und Apache Airflow.
Wählen Sie alle richtigen Antworten aus.
Batch vs. Streaming: das Latenzspektrum
Batch Processing bewegt Daten in geplanten Fenstern: stündlich, täglich, wöchentlich. Tools: Apache Spark, dbt, AWS Glue. Einsatz, wenn: Latenz akzeptabel ist (Reports über Nacht, wöchentliche Modelle), das Datenvolumen hoch und die Verarbeitung komplex ist.
Streaming Processing bewegt Daten in Echtzeit oder nahezu in Echtzeit (Sekunden bis Minuten). Tools: Apache Kafka, Apache Flink, AWS Kinesis, Google Pub/Sub. Einsatz, wenn: Geschäftsentscheidungen von aktuellen Daten abhängen (Fraud Detection, Echtzeit-Personalisierung, operative Dashboards).
Micro-Batch ist der Mittelweg: kleine Batches, die alle paar Minuten verarbeitet werden. Apache Spark Structured Streaming unterstützt das. Oft ausreichend, wenn echte Echtzeit nicht nötig ist, stündliche Batches aber zu langsam sind.
Die meisten Organisationen brauchen beides: Batch für schwere analytische Workloads, Streaming für operative Use Cases. Bauen Sie die Architektur so, dass sie beide Muster unterstützt, und nicht getrennte, inkompatible Systeme für jedes.
PipelinePipelineAll active sales opportunities across the stages of the sales process, together with their combined potential value and probability of closing.Vollständige Definition ansehen →-Orchestrierung
Orchestrierung beantwortet die Frage: Wer entscheidet, wann Pipelines laufen, in welcher Reihenfolge, und was passiert, wenn sie fehlschlagen?
Apache Airflow ist der dominierende Open-Source-Orchestrator. Pipelines werden als DAGs (Directed Acyclic Graphs) in Python definiert. Starkes Ökosystem, ausgereiftes Monitoring, komplex im Betrieb.
Prefect und Dagster sind moderne Alternativen mit besserer Developer Experience und nativer Unterstützung datenspezifischer Muster (Asset Materialization, Data LineageData LineageData lineage maps how data moves and transforms across systems, from origin to consumption, showing where it came from, what changed it, and where it goes.Vollständige Definition ansehen →).
dbt Cloud übernimmt die Orchestrierung speziell für Transformations-Workloads.
Im MaMaUsing software to automate repetitive marketing tasks and campaigns, enabling personalisation at scale across channels like email, web, and social.Vollständige Definition ansehen →ßstab wird die Komplexität der Orchestrierung zu einer erheblichen operativen Last. Airbnb betreibt täglich tausende Airflow-DAGs; DAG-Sprawl, Dependency-Management und Failure Recovery zu managen ist eine eigene Engineering-Funktion. CDOs sollten diese Kosten einplanen, wenn sie Headcount im Data Engineering festlegen.
Zuverlässigkeit von Data Pipelines
PipelinePipelineAll active sales opportunities across the stages of the sales process, together with their combined potential value and probability of closing.Vollständige Definition ansehen →-Zuverlässigkeit ist ein Thema erster Ordnung. Eine PipelinePipelineAll active sales opportunities across the stages of the sales process, together with their combined potential value and probability of closing.Vollständige Definition ansehen →, die stillschweigend falsche Ergebnisse produziert, ist schlimmer als eine, die laut scheitert. Zentrale Praktiken:
- Idempotenz: Eine PipelinePipelineAll active sales opportunities across the stages of the sales process, together with their combined potential value and probability of closing.Vollständige Definition ansehen → zweimal auszuführen sollte dasselbe Ergebnis liefern. Vermeiden Sie Append-only-Writes ohne Deduplizierung.
- Datenqualitätsprüfungen in jeder Stufe: Warten Sie mit der Validierung nicht bis zum Schluss, prüfen Sie bei der Ingestion, bei der Transformation, beim Laden.
- Alerting auf Qualität, nicht nur auf Fehler: Eine PipelinePipelineAll active sales opportunities across the stages of the sales process, together with their combined potential value and probability of closing.Vollständige Definition ansehen →, die läuft, aber 40 % Null-Werte produziert, ist gescheitert. Überwachen Sie Completeness, Freshness und SchemaSchemaA schema is the formal blueprint that defines how data is structured, named, typed, and related within a database, file, or message.Vollständige Definition ansehen → Drift, nicht nur den Job-Status.
- Lineage-Dokumentation: Wissen Sie, welche Downstream-Consumer von jeder PipelinePipelineAll active sales opportunities across the stages of the sales process, together with their combined potential value and probability of closing.Vollständige Definition ansehen → abhängen. Wenn sich eine PipelinePipelineAll active sales opportunities across the stages of the sales process, together with their combined potential value and probability of closing.Vollständige Definition ansehen → ändert, informieren Sie die Downstream-Teams proaktiv.
Architektur in der Praxis: das Medallion-Muster
Die Medallion-Architektur (Bronze → Silver → Gold) hat sich zum De-facto-Standard für Lake- und LakehouseLakehouseA hybrid architecture combining the flexibility of a data lake with the analytical capabilities of a data warehouse, on a single storage layer.Vollständige Definition ansehen →-Implementierungen entwickelt:
- Bronze: Rohe, unveränderte Daten aus der Ingestion, mit Metadaten (Load-Timestamp, Quellsystem). Niemals löschen. Das ist Ihr Audit Trail.
- Silver: Bereinigte, deduplizierte, standardisierte Daten. Joins angewendet. Business Rules teilweise durchgesetzt. Geeignet für Data-Science-Exploration.
- Gold: Aggregierte, geschäftsfertige Daten. Optimiert für bestimmte analytische Use Cases. Genutzt von BIBITechnologies and processes that turn raw data into actionable insights via reporting, dashboards and analysis, so teams can decide based on facts rather than intuition.Vollständige Definition ansehen →-Tools und Business-Stakeholdern.
Uber, Netflix und Databricks-Kunden nutzen dieses Muster breit. Es schafft klare Erwartungen an die Datenqualität in jeder Schicht und macht das Debugging schneller: Wenn eine Geschäftsmetrik falsch ist, wissen Sie, welche Schicht Sie zuerst untersuchen müssen.
Quizfragen
1. Warum ist ELTELTELT (Extract, Load, Transform) is a data integration pattern where raw data is loaded into a target system first, then transformed inside it using the platform's compute power.Vollständige Definition ansehen → zum modernen Default-Pattern geworden?
A) Es ist schneller als ETLETLETL (Extract, Transform, Load) is a data integration process that pulls data from sources, reshapes it into a consistent format, and writes it into a target system.Vollständige Definition ansehen →
B) Cloud-Warehouses bieten skalierbares Compute, sodass Rohdaten erhalten bleiben und bei Bedarf neu transformiert werden kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen
C) Es erfordert weniger technische Kompetenzen
D) Es senkt die Storage-Kosten
Antwort: B
2. Was enthält in der Medallion-Architektur die Bronze-Schicht?
A) Aggregierte, für BIBITechnologies and processes that turn raw data into actionable insights via reporting, dashboards and analysis, so teams can decide based on facts rather than intuition.Vollständige Definition ansehen → optimierte Daten
B) Bereinigte und standardisierte Daten
C) Rohe, unveränderte Daten mit Load-Metadaten
D) Produktionsdaten in Echtzeit
Antwort: C
3. Was ist der zentrale Unterschied zwischen Streaming und Micro-Batch?
A) Micro-Batch ist immer langsamer als Batch
B) Streaming verarbeitet jedes Event einzeln in Echtzeit, Micro-Batch verarbeitet kleine Lots alle paar Minuten
C) Micro-Batch ist identisch mit Streaming
D) Streaming funktioniert nur mit Kafka
Antwort: B
Was Sie aus dieser Lektion umsetzen
Diese Maßnahmen sind im Playbook der Rolle zusammengefasst.
- Pipelines auf das Medallion-Muster mit Bronze-, Silver- und Gold-Layer standardisieren
Verwandte Artikel
Aktuelle Blogartikel, die auf dieser Lektion aufbauen.
- DataDer moderne ELT-Stack: wie dbt, Ingestion und Orchestrierung tatsächlich zusammenspielenDas ELT-Muster hat die Art verändert, wie Data-Teams Pipelines bauen, doch das Akronym verbirgt in der Praxis erhebliche Komplexität. Dieser Artikel zeigt, wie dbt, Ingestion-Tools und Orchestrierungsebenen zusammenwirken und wo die eigentlichen Architekturentscheidungen liegen.
- DataWie Cloudflare seinen Data Stack rund um dbt, Fivetran und Airflow neu gebaut hatDas schnelle Wachstum von Cloudflare hat die Grenzen handgeschriebener SQL-Pipelines und fragmentierter Ingestion-Skripte offengelegt, die kein Engineer mehr anfassen wollte. Diese Case Study zeigt, wie das Unternehmen seinen analytischen Datenlayer mit einem modernen ELT-Ansatz umgebaut hat und was dieser Wechsel in der Praxis tatsächlich erfordert hat.
- DataDer moderne ELT-Stack erklärt: dbt, Ingestion und Orchestrierung im ZusammenspielDer Wechsel von ETL zu ELT hat die Art verändert, wie Datenteams Pipelines bauen. Die eigentliche Komplexität liegt aber darin, zu verstehen, wie die drei Schichten Ingestion, Transformation und Orchestrierung tatsächlich zusammenwirken. Dieser Artikel zerlegt die Mechanik des modernen Stacks anhand konkreter Beispiele und zeigt, wo die echten Tradeoffs für Führungskräfte liegen, die Architekturentscheidungen treffen.