Data Warehouse, Lake & Lakehouse: die richtige Architektur wählen
Jeder CDO kennt diese Frage: „Wie soll unsere Datenarchitektur aussehen?“
Die Antwort hat sich im letzten Jahrzehnt massiv verändert. Das monolithische Data WarehouseData WarehouseEin zentrales Repository, das Daten aus vielen Quellsystemen in einem strukturierten, abfrageoptimierten Speicher zusammenführt, ausgelegt für Analytics, Reporting und Business Intelligence.Vollständige Definition ansehen →, einst der Goldstandard, ist heute nur eine Option unter vielen. Für die richtigen Architekturentscheidungen müssen Sie wissen, was es gibt, welche Trade-offs jede Option mitbringt und wie Sie Architektur und Business-Anforderung zusammenbringen.
Das Feld der Datenarchitekturen
Der Modern Data Stack hat auf Einfachheit zusätzliche Komplexität gelegt. Das gibt es heute:
Data Warehouse: Strukturierter, per SQLSQLSales Qualified Lead: ein Prospect, den das Sales-Team als bereit für direkte Ansprache und ein Angebot validiert hat, weil er klare Qualifizierungskriterien erfüllt.Vollständige Definition ansehen → abfragbarer Speicher, optimiert für Analytics. Beispiele: Snowflake, BigQuery, Redshift. Am besten geeignet für: Business IntelligenceBusiness IntelligenceTechnologien und Prozesse, die Rohdaten über Reporting, Dashboards und Analysen in verwertbare Insights überführen, damit Teams auf Basis von Fakten statt Intuition entscheiden.Vollständige Definition ansehen →, Dashboards, strukturiertes Reporting.
Data Lake: Rohdatenspeicher in großem MaMaEinsatz von Software, um wiederkehrende Marketingaufgaben und Kampagnen zu automatisieren und Personalisierung in großem Maßstab über Kanäle wie E-Mail, Web und Social zu ermöglichen.Vollständige Definition ansehen →ßstab, strukturierte, semi-strukturierte und unstrukturierte Daten. Beispiele: AWS S3, Azure Data LakeData LakeEin Data Lake ist ein zentraler Speicher, der große Datenmengen im Rohformat ablegt, von strukturierten Tabellen bis zu unstrukturierten Dateien, bis sie gebraucht werden.Vollständige Definition ansehen →, GCS. Am besten geeignet für: alles speichern, kkDie durchschnittliche Zahl neuer Nutzer, die jeder bestehende Nutzer über Empfehlungen generiert. Über 1,0 verstärkt sich das Wachstum selbst und wird exponentiell.Vollständige Definition ansehen →ünftige Use Cases ermöglichen.
Data Lakehouse: Der Hybrid, der aus der Reibung zwischen Lakes und Warehouses entstanden ist. ACID-Transaktionen, SchemaSchemaEin Schema ist der formale Bauplan, der festlegt, wie Daten in einer Datenbank, einer Datei oder einer Nachricht strukturiert, benannt, typisiert und miteinander verknüpft sind.Vollständige Definition ansehen → Enforcement und SQLSQLSales Qualified Lead: ein Prospect, den das Sales-Team als bereit für direkte Ansprache und ein Angebot validiert hat, weil er klare Qualifizierungskriterien erfüllt.Vollständige Definition ansehen →-Abfragen auf Lake-Storage. Beispiele: Databricks Delta Lake, Apache Iceberg, Apache Hudi.
Data Mesh: Keine Technologie, sondern ein organisatorisches und architektonisches Paradigma. Data Ownership wird an Domain-Teams verteilt. Jede Domain produziert Data Products. Federated Governance. Mehr dazu in Modul 3.2.
Data Fabric: Eine Architekturschicht, die verstreute Datenquellen über Metadaten und automatisierte Integration verbindet. Weniger Storage, mehr Konnektivität und Discovery.
Modern Data Stack Explained
Wissenscheck
1. Was unterscheidet ein Data Lakehouse grundlegend von einem klassischen Data Lake?
2. Ein Handelsunternehmen braucht vor allem schnelle, verlässliche BI-Dashboards mit SLA-Zusagen an die Fachbereiche, die Daten sind gut strukturiert und das Team arbeitet SQL-native. Welche Architektur passt am besten?
3. Warum wird ein Data Mesh als grundlegend anders beschrieben als Warehouse, Lake oder Lakehouse?
4. Wählen Sie ALLE Szenarien, in denen ein Data Lake die passendste Entscheidung ist.
Wählen Sie alle richtigen Antworten aus.
5. Wählen Sie ALLE Aussagen, die korrekt beschreiben, wann ein Lakehouse die richtige architektonische Wahl ist.
Wählen Sie alle richtigen Antworten aus.
Warehouse vs. Lake vs. LakehouseLakehouseEine hybride Architektur, die die Flexibilität eines Data Lake mit den analytischen Fähigkeiten eines Data Warehouse auf einer einzigen Storage-Schicht verbindet.Vollständige Definition ansehen →
Die Debatte Warehouse–Lake–LakehouseLakehouseEine hybride Architektur, die die Flexibilität eines Data Lake mit den analytischen Fähigkeiten eines Data Warehouse auf einer einzigen Storage-Schicht verbindet.Vollständige Definition ansehen → läuft in jedem Data-Team noch. So kkDie durchschnittliche Zahl neuer Nutzer, die jeder bestehende Nutzer über Empfehlungen generiert. Über 1,0 verstärkt sich das Wachstum selbst und wird exponentiell.Vollständige Definition ansehen →önnen Sie sie einordnen:
Nehmen Sie ein Data Warehouse, wenn: Ihr primärer Use Case BIBITechnologien und Prozesse, die Rohdaten über Reporting, Dashboards und Analysen in verwertbare Insights überführen, damit Teams auf Basis von Fakten statt Intuition entscheiden.Vollständige Definition ansehen → und Reporting ist, Ihre Daten strukturiert sind, Ihr Team SQLSQLSales Qualified Lead: ein Prospect, den das Sales-Team als bereit für direkte Ansprache und ein Angebot validiert hat, weil er klare Qualifizierungskriterien erfüllt.Vollständige Definition ansehen →-native arbeitet und Sie garantierte Query-Performance mit SLA-Zusagen an die Fachbereiche brauchen.
Nehmen Sie einen Data Lake, wenn: Sie riesige unstrukturierte Datenmengen haben (Logs, Clickstreams, Bilder, Dokumente), Rohdaten für kkDie durchschnittliche Zahl neuer Nutzer, die jeder bestehende Nutzer über Empfehlungen generiert. Über 1,0 verstärkt sich das Wachstum selbst und wird exponentiell.Vollständige Definition ansehen →ünftige ML-Use-Cases erhalten wollen oder Storage-Kosten ein zentrales Thema sind.
Nehmen Sie ein Lakehouse, wenn: Sie die Flexibilität eines Lake mit der Verlässlichkeit eines Warehouse verbinden wollen. Sie sind eine datenintensive Organisation und machen sowohl ML als auch BIBITechnologien und Prozesse, die Rohdaten über Reporting, Dashboards und Analysen in verwertbare Insights überführen, damit Teams auf Basis von Fakten statt Intuition entscheiden.Vollständige Definition ansehen →. Sie kkDie durchschnittliche Zahl neuer Nutzer, die jeder bestehende Nutzer über Empfehlungen generiert. Über 1,0 verstärkt sich das Wachstum selbst und wird exponentiell.Vollständige Definition ansehen →önnen sich zwei getrennte Systeme nicht leisten. Für datenreife Organisationen wird das zunehmend zum Standard.
Wie das LakehouseLakehouseEine hybride Architektur, die die Flexibilität eines Data Lake mit den analytischen Fähigkeiten eines Data Warehouse auf einer einzigen Storage-Schicht verbindet.Vollständige Definition ansehen → entstand
Das LakehouseLakehouseEine hybride Architektur, die die Flexibilität eines Data Lake mit den analytischen Fähigkeiten eines Data Warehouse auf einer einzigen Storage-Schicht verbindet.Vollständige Definition ansehen →-Muster entstand aus einem konkreten Schmerz: Organisationen bauten Data Lakes, stellten fest, dass daraus unbrauchbare Sümpfe unstrukturierter Daten wurden, und brauchten Warehouse-artige Verlässlichkeit, ohne ihre Lake-Investitionen aufzugeben.
Delta Lake (Databricks), Apache Iceberg und Apache Hudi lösten das, indem sie ACID-Transaktionen, SchemaSchemaEin Schema ist der formale Bauplan, der festlegt, wie Daten in einer Datenbank, einer Datei oder einer Nachricht strukturiert, benannt, typisiert und miteinander verknüpft sind.Vollständige Definition ansehen → Evolution und Time-Travel-Funktionen auf Object Storage brachten. Das Ergebnis: Storage-Kosten eines Lake bei der Query-Verlässlichkeit eines Warehouse.
Netflix hat seine komplette Dateninfrastruktur auf Apache Iceberg migriert. Dort werden hunderte Petabyte an Daten verwaltet, mit SchemaSchemaEin Schema ist der formale Bauplan, der festlegt, wie Daten in einer Datenbank, einer Datei oder einer Nachricht strukturiert, benannt, typisiert und miteinander verknüpft sind.Vollständige Definition ansehen → Evolution, Rollback-Möglichkeit und parallelem Lesen und Schreiben, also Funktionen, die es früher nur in teuren proprietären Warehouses gab.
Entscheidungsrahmen für die Architektur
Stellen Sie bei der Bewertung von Architekturoptionen vier Fragen:
- Art der Workloads: Geht es um BIBITechnologien und Prozesse, die Rohdaten über Reporting, Dashboards und Analysen in verwertbare Insights überführen, damit Teams auf Basis von Fakten statt Intuition entscheiden.Vollständige Definition ansehen →, ML, Streaming oder alle drei? Unterschiedliche Workloads sprechen für unterschiedliche Architekturen.
- Skills im Team: SQLSQLSales Qualified Lead: ein Prospect, den das Sales-Team als bereit für direkte Ansprache und ein Angebot validiert hat, weil er klare Qualifizierungskriterien erfüllt.Vollständige Definition ansehen →-native Teams tendieren zu Warehouses, Python-native Teams zu Lakes.
- Datenvolumen und -vielfalt: Hohes Volumen + hohe Vielfalt = Lake oder LakehouseLakehouseEine hybride Architektur, die die Flexibilität eines Data Lake mit den analytischen Fähigkeiten eines Data Warehouse auf einer einzigen Storage-Schicht verbindet.Vollständige Definition ansehen →. Strukturierte Daten bei moderatem Volumen = Warehouse.
- Toleranz für Vendor Lock-in: Cloud-native Warehouses (Snowflake, BigQuery) bieten Bequemlichkeit auf Kosten der Portabilität. Offene Formate (Iceberg, Delta) maximieren Portabilität.
Es gibt keine allgemeingültig richtige Antwort. Eine gut begründete Architektur, die zu Ihren tatsächlichen Workloads passt, schlägt eine ausgefeilte Architektur, die Ihr Team nicht betreiben kann.
Quizfragen
1. Quelle est la principale différence entre un data lakedata lakeEin Data Lake ist ein zentraler Speicher, der große Datenmengen im Rohformat ablegt, von strukturierten Tabellen bis zu unstrukturierten Dateien, bis sie gebraucht werden.Vollständige Definition ansehen → et un data lakehousedata lakehouseEine hybride Architektur, die die Flexibilität eines Data Lake mit den analytischen Fähigkeiten eines Data Warehouse auf einer einzigen Storage-Schicht verbindet.Vollständige Definition ansehen → ?
A) Le lakehouselakehouseEine hybride Architektur, die die Flexibilität eines Data Lake mit den analytischen Fähigkeiten eines Data Warehouse auf einer einzigen Storage-Schicht verbindet.Vollständige Definition ansehen → est plus cher
B) Le lakehouselakehouseEine hybride Architektur, die die Flexibilität eines Data Lake mit den analytischen Fähigkeiten eines Data Warehouse auf einer einzigen Storage-Schicht verbindet.Vollständige Definition ansehen → ajoute des transactions ACID et la fiabilité d'un warehouse sur un stockage de type lake
C) Le lakehouselakehouseEine hybride Architektur, die die Flexibilität eines Data Lake mit den analytischen Fähigkeiten eines Data Warehouse auf einer einzigen Storage-Schicht verbindet.Vollständige Definition ansehen → ne supporte pas le SQLSQLSales Qualified Lead: ein Prospect, den das Sales-Team als bereit für direkte Ansprache und ein Angebot validiert hat, weil er klare Qualifizierungskriterien erfüllt.Vollständige Definition ansehen →
D) Le lakehouselakehouseEine hybride Architektur, die die Flexibilität eines Data Lake mit den analytischen Fähigkeiten eines Data Warehouse auf einer einzigen Storage-Schicht verbindet.Vollständige Definition ansehen → est uniquement pour les données non structurées
Réponse: B
2. Quelle architecture choisir en priorité pour une équipe BIBITechnologien und Prozesse, die Rohdaten über Reporting, Dashboards und Analysen in verwertbare Insights überführen, damit Teams auf Basis von Fakten statt Intuition entscheiden.Vollständige Definition ansehen → SQLSQLSales Qualified Lead: ein Prospect, den das Sales-Team als bereit für direkte Ansprache und ein Angebot validiert hat, weil er klare Qualifizierungskriterien erfüllt.Vollständige Definition ansehen →-native avec des données structurées ?
A) Data lakeData lakeEin Data Lake ist ein zentraler Speicher, der große Datenmengen im Rohformat ablegt, von strukturierten Tabellen bis zu unstrukturierten Dateien, bis sie gebraucht werden.Vollständige Definition ansehen →
B) Data meshData meshData Mesh ist ein dezentraler Ansatz für Datenarchitektur und Organisation, bei dem Domänenteams ihre Daten besitzen und als Produkte bereitstellen, geregelt durch gemeinsame Standards.Vollständige Definition ansehen →
C) Data warehouseData warehouseEin zentrales Repository, das Daten aus vielen Quellsystemen in einem strukturierten, abfrageoptimierten Speicher zusammenführt, ausgelegt für Analytics, Reporting und Business Intelligence.Vollständige Definition ansehen →
D) Data fabric
Réponse: C
3. Quel projet open source a permis à Netflix de gérer des centaines de pétaoctets avec des capacités ACID ?
A) Apache Kafka
B) Apache Hudi
C) Apache Iceberg
D) Delta Lake
Réponse: C
Was Sie aus dieser Lektion umsetzen
Diese Maßnahmen sind im Playbook der Rolle zusammengefasst.
- Architektur anhand von Workload, Team-Skills, Volumen und Lock-in-Toleranz wählen
Verwandte Artikel
Aktuelle Blogartikel, die auf dieser Lektion aufbauen.
- DataData Mesh vs. Data Lakehouse: Was CDOs 2026 wirklich entscheiden müssenDie Debatte zwischen Data-Mesh- und Data-Lakehouse-Architekturen hat die Theorie verlassen und ist in den Budgetgesprächen der Vorstandsetage angekommen. Das steckt tatsächlich hinter der Entscheidung, und deshalb ist es der erste Fehler der meisten CDOs, die Frage als Entweder-oder zu stellen.
- DataData Mesh vs. Data Lakehouse: Worüber CDOs 2026 wirklich entscheiden müssenDie Debatte zwischen Data Mesh und Lakehouse-Architekturen hat die Whitepaper-Theorie verlassen und hat inzwischen konkrete organisatorische Folgen. CDOs, die das als rein technische Entscheidung behandeln, sind bereits im Rückstand.
- DataData Mesh vs. Data Lakehouse: Was die Architekturdebatte wirklich kostetDie Wahl zwischen Data Mesh und Data Lakehouse ist längst keine technische Debatte mehr, die sich auf Engineering-Teams beschränkt. CDOs, die sie als solche behandeln, verlieren bereits an Boden, bei der Delivery-Geschwindigkeit wie bei der Data Governance.