Block 3

Moderne Datenarchitektur

Data Warehouses, Lakes, Lakehouses, Data Mesh, Pipelines und einen modernen Data Stack entwerfen

5 Module·15 Lektionen

Jede Datenstrategie steht und fällt mit ihrer Architektur. Sie können die besten Data Scientists am Markt einstellen, aber wenn Storage, Pipelines und Transformationsschichten ein Geflecht aus Legacy-Kompromissen sind, verbringen Ihre Teams ihre Tage mit Firefighting statt mit Ergebnissen. Dieser Block legt die Architekturentscheidungen dorthin, wo sie hingehören: auf Ihren Schreibtisch.

Sie beginnen mit den Grundlagen, über die alle streiten und die wenige richtig hinbekommen. Data Warehouse, Lake oder Lakehouse, und wie Sie wählen, ohne dem Vendor des Monats zu folgen. Cloud-Infrastruktur mit echter Kostenrechnung statt Marketingbroschüren. Pipelines, die wirklich tragen, von ETL und ELT über Batch und Streaming bis zur Medallion-Architektur, die Ihre Daten auf jeder Stufe vertrauenswürdig hält.

Dann gehen Sie dorthin, wo die scharfsinnigen CDOs hinschauen. Data Mesh, seine tatsächlichen Prinzipien, die Bedingungen, die es verlangt, und die ehrlichen Kritikpunkte, die Berater auslassen. Data Products, behandelt als Produkte, mit Design, Ownership und Lifecycle-Management. Streaming mit Apache Kafka für die Momente, in denen die Daten von gestern wertlos sind.

Zum Schluss industrialisieren Sie. dbt macht aus SQL-Transformation statt Handwerk eine Fabrik. Data Observability fängt Probleme ab, bevor Ihre Nutzer ein Ticket öffnen. Arbeit an Performance und Skalierbarkeit, Partitionierung, Clustering und Kostenoptimierung, sorgt dafür, dass Ihre Plattform wächst, ohne dass Ihre Rechnung schneller wächst.

Das ist kein Kurs für Engineers. Es ist die Architektur-Fluency, mit der Sie Ihre Teams herausfordern, schlechte Vorschläge früh beerdigen und die richtigen finanzieren. Sie werden die Pipelines nicht schreiben. Sie werden genau wissen, warum ein Design gewinnt und ein anderes Geld und Glaubwürdigkeit verbrennt. Das ist der Unterschied zwischen einem CDO, der Architektur abnickt, und einem, der sie verantwortet.

Was Sie beherrschen werden

  • Zwischen Warehouse, Lake und Lakehouse auf Basis Ihrer tatsächlichen Workloads und Kosten wählen
  • Cloud-Dateninfrastruktur bewerten, mit klarem Griff auf Services, Migrationsrisiko und Gesamtkosten
  • Pipelines über Batch und Streaming hinweg mit der Medallion-Architektur entwerfen
  • Einschätzen, ob Data Mesh zu Ihrer Organisation passt oder sie zum Scheitern bringt
  • Daten als Produkte behandeln, mit echter Ownership, echtem Design und Lifecycle-Governance
  • dbt und Observability einführen, damit Qualitätsprobleme vor Ihren Nutzern sichtbar werden
  • Performance und Kosten über Partitionierung, Clustering und intelligentes Skalieren optimieren

Module

Häufige Fragen

Für wen ist der Block Moderne Datenarchitektur gedacht?

Er richtet sich an CDOs, Data Leaders und Führungskräfte, die Architekturentscheidungen freigeben, ohne den Code zu schreiben. Die 5 Module und 15 Lektionen behandeln Warehouses, Lakes, Lakehouses, Pipelines, Data Mesh, dbt und Observability auf Entscheidungsebene, nicht auf Implementierungsebene. Wenn Sie ein Vendor-Angebot oder das Design eines Teams hinterfragen müssen, ist das die richtige Flughöhe.

Muss ich technisch sein, um folgen zu können?

Nein. Moderne Datenarchitektur geht davon aus, dass Sie die Pipelines nie selbst bauen werden. Das Ziel ist Architektur-Fluency: verstehen, warum ein Design gewinnt und ein anderes Geld verbrennt, damit Sie schwache Vorschläge früh beerdigen und die richtigen finanzieren. Etwas Vertrautheit mit SQL und Cloud-Vokabular hilft, ist aber nicht erforderlich.

Was ist der Unterschied zwischen Data Warehouse, Data Lake und Lakehouse?

Ein Warehouse speichert strukturierte, modellierte Daten für Analytics; ein Lake speichert Rohdaten in beliebigem Format zu niedrigen Kosten; ein Lakehouse kombiniert Lake-Storage mit Query- und Governance-Schichten im Warehouse-Stil. Die erste Lektion des Blocks geht die Wahl anhand Ihrer tatsächlichen Workloads und Kosten durch statt anhand des Vendors des Monats, und eine spätere Lektion behandelt, wie das Lakehouse Analytics und Machine Learning auf gemeinsamen Daten zusammenführt.

Wo soll ich anfangen, wenn meine aktuelle Datenplattform ein Geflecht aus Legacy-Pipelines ist?

Beginnen Sie mit dem Modul zu Storage- und Cloud-Architektur: Warehouse versus Lake versus Lakehouse, Cloud-Services mit echter Kostenrechnung und Migrationsrisiko, dann Pipelines von ETL und ELT über Batch und Streaming bis zur Medallion-Architektur. Zuerst die Storage- und Transformationsschichten in Ordnung zu bringen ist das, was Teams aus dem Firefighting holt. Data Mesh und Streaming kommen später, wenn die Grundlagen tragen.

Bezieht der Block Position zu Data Mesh?

Ja, eine differenzierte. Die Lektion zu Data Mesh behandelt die Prinzipien, die organisatorischen Voraussetzungen und die ehrlichen Kritikpunkte, die Berater gern auslassen, damit Sie beurteilen können, ob es zu Ihrer Organisation passt oder sie zum Scheitern bringt. Eine ergänzende Lektion behandelt Data Products mit echtem Design, echter Ownership und Lifecycle-Management, und genau daran scheitern die meisten Data-Mesh-Versuche.

Wie geht der Block mit Cloud-Datenkosten um?

Auf zwei Wegen. Die Lektion zu Performance und Skalierbarkeit behandelt Partitionierung, Clustering und Kostenoptimierung, damit eine wachsende Plattform nicht die Rechnung schneller wachsen lässt, und eine eigene Lektion zu Data FinOps behandelt die Steuerung der Cloud-Datenausgaben. Die Lektion zur Cloud-Infrastruktur betrachtet Services und Migration ebenfalls in Gesamtkosten statt in Listenpreisen.