Der moderne ELT-Stack: wie dbt, Ingestion und Orchestrierung tatsächlich zusammenspielen
Das ELT-Muster hat die Art verändert, wie Data-Teams Pipelines bauen, doch das Akronym verbirgt in der Praxis erhebliche Komplexität. Dieser Artikel zeigt, wie dbt, Ingestion-Tools und Orchestrierungsebenen zusammenwirken und wo die eigentlichen Architekturentscheidungen liegen.
Claude VectorData & Analytics Lead6. September 2026Podcast anhören
4 min
Im Zentrum dieses Artikels steht der moderne ELTELTELT (Extract, Load, Transform) ist ein Muster der Datenintegration, bei dem Rohdaten zuerst in ein Zielsystem geladen und dann dort mit der Rechenleistung der Plattform transformiert werden.Vollständige Definition ansehen →-Stack: die Kombination aus Data Ingestion, Transformation im Warehouse per dbt und Workflow-Orchestrierung. Die meisten CDOs kkDie durchschnittliche Zahl neuer Nutzer, die jeder bestehende Nutzer über Empfehlungen generiert. Über 1,0 verstärkt sich das Wachstum selbst und wird exponentiell.Vollständige Definition ansehen →önnen diese Komponenten benennen. Weniger können genau erklären, wie sie zusammenwirken, wo die eine endet und die andere beginnt, oder warum ein schlecht verdrahteter Stack brbrDer Anteil der Besucher, die nach nur einer angesehenen Seite wieder abspringen, häufig ein Signal für mangelnde Relevanz, verfehlte Suchintention oder schwache User Experience.Vollständige Definition ansehen →üchige Pipelines produziert, die im schlechtesten Moment zusammenbrechen.
Die Verwirrung ist verständlich. Die Anbieter in diesem Feld vermarkten jede Ebene isoliert. Fivetran spricht über Ingestion. dbt Labs spricht über Transformation. Astronomer, Prefect und Dagster sprechen über Orchestrierung. Keiner von ihnen hat ein starkes kommerzielles Interesse daran, das Gesamtbild klar zu erklären, also muss die Klarheit von anderer Stelle kommen.
Warum das speziell für einen CDO relevant ist
Ein CDO, der nicht über Stack-Architektur nachdenken kann, landet in einem von zwei Fehlermodi. Entweder überlässt ererDas Verhältnis von Interaktionen (Likes, Kommentare, Shares) zur Reichweite eines Inhalts. Zeigt, wie stark die Zielgruppe reagiert, gemessen an der Zahl der Personen, die den Inhalt gesehen haben.Vollständige Definition ansehen → alles dem Engineering und verliert Einfluss auf Entscheidungen, die Datenqualität, Kosten und Time-to-Insight direkt betreffen. Oder er genehmigt Tools, ohne die Abhängigkeiten zwischen ihnen zu verstehen, und erbt technische Schulden, die später die Kapazität des Teams auffressen.
Stack-Entscheidungen, die 2026 getroffen werden, bestimmen, was Ihr Team 2028 liefern kann. Sorgfältig zusammengesetzt verkürzt der moderne ELT-Stack die Zeit zwischen dem Eintreffen von Rohdaten und der Abfragbarkeit einer Business-Metrik von Tagen auf Minuten. Nachlässig zusammengesetzt entstehen Pipelines, in denen eine SchemaSchemaEin Schema ist der formale Bauplan, der festlegt, wie Daten in einer Datenbank, einer Datei oder einer Nachricht strukturiert, benannt, typisiert und miteinander verknüpft sind.Vollständige Definition ansehen →änderung im Quellsystem stillschweigend ein Dashboard beschädigt, das der CFO jeden Montagmorgen nutzt.
Das ist eine Architekturentscheidung mit einem Geschäftsrisikoprofil. CDOs sollten sie verantworten.
Wie der Stack tatsächlich funktioniert: die Mechanik
Die drei Ebenen, der Reihe nach
Beginnen wir mit Ingestion. Tools wie Fivetran, Airbyte (das sich als Open Source positioniert, wobei das Cloud-Angebot kommerziell ist) und Stitch ziehen Daten aus Quellsystemen und laden sie in ein Cloud Data WarehouseData WarehouseEin zentrales Repository, das Daten aus vielen Quellsystemen in einem strukturierten, abfrageoptimierten Speicher zusammenführt, ausgelegt für Analytics, Reporting und Business Intelligence.Vollständige Definition ansehen → wie Snowflake, BigQuery oder Databricks. Sie kümmern sich um APIAPIApplication Programming Interface: eine standardisierte Schnittstelle, über die Anwendungen kommunizieren und Daten austauschen, ohne die interne Funktionsweise der jeweils anderen zu kennen.Vollständige Definition ansehen →-Verbindungen, Authentifizierung, inkrementelles Laden und einfaches Schema-Mapping. Was sie nicht tun: die Daten in etwas analytisch Brauchbares transformieren. Ein Fivetran-Connector für Salesforce landet rohe Salesforce-Tabellen in Ihrem Warehouse, samt Spaltennamen. Die Tabelle `opportunity` sieht genau wie das interne Schema von Salesforce aus, und das ist selten, was ein Analyst braucht.
An dieser Stelle kommt dbt ins Spiel. dbt (data build tool, entwickelt von dbt Labs) führt SQLSQLSales Qualified Lead: ein Prospect, den das Sales-Team als bereit für direkte Ansprache und ein Angebot validiert hat, weil er klare Qualifizierungskriterien erfüllt.Vollständige Definition ansehen →-basierte Transformationen im Warehouse selbst aus. Statt Daten zur Verarbeitung auf einen separaten Server zu verschieben, schickt dbt SQL-Abfragen an Snowflake oder BigQuery und materialisiert die Ergebnisse als Views oder Tabellen. Ein Team in einem SaaS-Unternehmen könnte dbt zum Beispiel nutzen, um die rohe Salesforce-Tabelle `opportunity` mit den Stripe-Zahlungsdaten zu verknüpfen, Geschäftslogik dafür anzuwenden, was als abgeschlossener Deal zählt, und ein sauberes Modell `dim_customers` und `fct_revenue` zu erzeugen, das Analysten direkt abfragen können. dbt erzeugt außerdem einen Lineage-Graph, führt Tests auf Zeilenzahlen und Null-Raten aus und kompiliert die Dokumentation automatisch.
Die dritte Ebene ist die Orchestrierung. Ein Tool wie Apache Airflow (der Open-Source-Standard, kommerziell betreut von Astronomer), Dagster oder Prefect definiert, wann und in welcher Reihenfolge Dinge laufen. Es plant den Fivetran-Sync, wartet auf dessen Abschluss, löst dann den dbt-Run aus und sendet einen Slack-Alert, wenn ein dbt-Test fehlschlägt. Ohne Orchestrierung sind diese Schritte unverbunden. Jemand startet dbt manuell, bevor der Fivetran-Sync fertig ist, und erhält veraltete Ergebnisse. Ein Orchestrator macht die Abhängigkeit explizit und erzwingt sie.
Ein konkretes Beispiel
Ein Einzelhandelsunternehmen zieht stündlich Transaktionsdaten aus Shopify über Airbyte in BigQuery. dbt führt dann eine Reihe von Modellen aus, die die rohen Transaktionsdatensätze bereinigen, sie mit einem aus einem Google Sheet geladenen Produktkatalog verknüpfen (ja, das kommt häufig vor) und ein tägliches Umsatzmodell nach SKU und Region erzeugen. Dagster orchestriert die gesamte Sequenz: es wartet auf die Sync-Bestätigung von Airbyte, löst dbt aus und schickt die Testergebnisse an ein Monitoring-Dashboard. Wenn Shopify einen Feldnamen in der API ändert, fängt Airbyte das bei der Ingestion auf, das dbt-Modell, das dieses Feld referenziert, scheitert an seinen Tests, und Dagster meldet den Fehler, bevor er den BIBITechnologien und Prozesse, die Rohdaten über Reporting, Dashboards und Analysen in verwertbare Insights überführen, damit Teams auf Basis von Fakten statt Intuition entscheiden.Vollständige Definition ansehen →-Layer erreicht. Das Dashboard des CFO zeigt veraltete Daten mit einer sichtbaren Staleness-Warnung statt stillschweigend falscher Daten.
Dieser Umgang mit dem Fehlermodus passiert nicht automatisch. Es braucht jemanden, der die Tests konfiguriert, die Abhängigkeiten verdrahtet und definiert, was „Fehler“ bedeutet. In dieser Designarbeit liegt der eigentliche Wert.
Wann dieser Stack passt und wann nicht
Der moderne ELT-Stack ist angemessen, wenn Ihre analytische Last vor allem SQL-basiert ist, Ihre Datenvolumina ein Cloud Warehouse rechtfertigen und Sie mindestens ein kleines Team (zwei oder drei Personen) haben, das diese Tools pflegen kann. Besonders gut funktioniert er für Unternehmen mit vielen Quellsystemen, weil die Ingestion-Ebene die Connector-Komplexität von der Transformationsebene abschirmt.
Die Tradeoffs sollten ehrlich benannt werden. dbt ist kein Allzweck-Tool zur Datenverarbeitung. Es kann Streaming-Daten nicht nativ verarbeiten (dbt Labs hat zwar dbt-Streaming-Integrationen eingeführt, die aber Stand 2026 noch reifen). Für komplexe Machine-Learning-Feature-Pipelines, bei denen an jedem Schritt Python-Berechnungen nötig sind, ist es nicht geeignet. In solchen Fällen kombinieren Teams dbt häufig mit etwas wie Spark oder einem dedizierten Feature StoreFeature StoreEin zentrales Repository zur Verwaltung von ML-Features, das Konsistenz zwischen Training und Serving sicherstellt.Vollständige Definition ansehen →.
Orchestrierung bringt zudem echten operativen Aufwand mit sich. Airflow hat besonders den Ruf, im großen MaMaEinsatz von Software, um wiederkehrende Marketingaufgaben und Kampagnen zu automatisieren und Personalisierung in großem Maßstab über Kanäle wie E-Mail, Web und Social zu ermöglichen.Vollständige Definition ansehen →ßstab schwer zu pflegen zu sein. Das asset-basierte Modell von Dagster ist konzeptionell klarer und hat sich seit 2023 in Data-Engineering-Teams deutlich verbreitet, verlangt aber ein anderes Denkmodell als task-basiertes Scheduling. Die Wahl eines Orchestrators ist eine Entscheidung für vier Jahre, nicht für ein Quartal.
Das größte Risiko bei diesem Stack ist, ihn als Sammlung unabhängiger Tools zu behandeln, die separat gekauft und später integriert werden. Die Lineage von der Ingestion über die Transformation bis zur Bereitstellung muss als Ganzes entworfen werden. Teams, die erst Fivetran kaufen, dann dbt entdecken und danach Airflow ergänzen, landen oft bei fragilen Pipelines, in denen die Orchestrierungsebene keine Sicht darauf hat, was die Ingestion-Ebene tatsächlich getan hat.
Die Aufgabe des CDO ist, dafür zu sorgen, dass jemand im Team das gesamte Architekturbild im Kopf hat, nicht nur Expertise in einer Ebene. Diese Person, oder diese Funktion, ist der Unterschied zwischen einer modernen Datenplattform und einem modernen Datenchaos.
Mehr dazu
Die Lektionen, die diesen Artikel weiterführen, frei zugänglich.
- 1dbt (data build tool): industrialisierte SQL-TransformationModerne Datenarchitektur
- 2Data Pipelines: ETL/ELT, Batch, Streaming und Medallion-ArchitekturModerne Datenarchitektur
- 3Data observability: Probleme erkennen, bevor Ihre Nutzer sie bemerkenModerne Datenarchitektur
- 4Data Contracts: der neue Standard für Qualitätsvereinbarungen zwischen TeamsData Governance & Compliance
- 5Data FinOps: Cloud-Datenkosten im GriffModerne Datenarchitektur
Artikel gelesen?
Bestätigen Sie Ihre Lektüre, um XP zu sammeln und Ihr Radar zu füttern.