Glossar
DataKIgeneral

Data Pipeline

Auch: data pipeline, pipeline, ETL pipeline, ELT pipeline, data flow, pipeline de données, chaîne de traitement des données

Eine automatisierte Folge von Schritten, die Daten von der Quelle zum Ziel bewegt: Ingestion, Transformation, Validierung und Laden, damit sie saubere und nutzbare Form erreichen.

Was es ist

Eine Data Pipeline ist eine automatisierte Folge von Schritten, die Daten von ihrem Ursprung (einer Quelle) dorthin bringt, wo sie genutzt werden (dem Ziel), und sie auf dem Weg verarbeitet. Die zentralen Stufen sind üblicherweise:

  • Ingestion: Rohdaten aus Quellen wie Datenbanken, APIs, Dateien, Event Streams oder SaaS-Tools abrufen oder empfangen.
  • Transformation: Daten bereinigen, umformen, verknüpfen und anreichern, bis sie nutzbar sind.
  • Validierung: Qualität, Vollständigkeit und Einhaltung der erwarteten Regeln prüfen, bevor die Daten weiterlaufen.
  • Laden: das Ergebnis in ein Ziel schreiben, etwa ein Data Warehouse, einen Data Lake, ein Dashboard oder eine Anwendung.

Pipelines können im Batch-Modus laufen (geplant, zum Beispiel stündlich oder nachts) oder im Streaming-Modus (durchgehend, nahezu in Echtzeit).

Warum es zählt

Ohne Pipelines bleiben Daten in Silos gefangen, und jede Analyse wird zur manuellen, fehleranfälligen Copy-Paste-Übung. Eine gut gebaute Pipeline liefert:

  • Zuverlässigkeit: dieselben Schritte laufen jedes Mal gleich ab, mit Monitoring und Alerts.
  • Aktualität: Entscheidungen beruhen auf aktuellen Daten, nicht auf dem Export des letzten Quartals.
  • Vertrauen: die Validierung fängt fehlerhafte Daten ab, bevor sie in Reports oder Modelle gelangen.
  • Skalierung: Volumina, die ein Mensch nie von Hand verarbeiten könnte, laufen automatisch durch.

Für Führungskräfte ist die Pipeline die Leitungsinfrastruktur hinter jedem Dashboard, jedem Forecast und jedem KI-Feature. Wenn sie unbemerkt ausfällt, driften die Zahlen und das Vertrauen schwindet.

Wie es in der Praxis genutzt wird

Teams beschreiben Pipelines als Code (oft Orchestrierung genannt), planen sie ein und überwachen jeden Lauf. Praktisch wichtig sind der saubere Umgang mit Fehlern, die Neuverarbeitung bei Änderungen an einer Quelle, das Nachverfolgen der Lineage (woher jede Zahl kommt) und die Kostenkontrolle.

Durchgerechnetes Beispiel

Ein Einzelhändler will ein tägliches Dashboard mit Umsatz nach Region:

1. Ingestion: jede Nacht holt die Pipeline die Bestellungen aus der E-Commerce-Datenbank und die Wechselkurse aus einer Currency-API.

2. Transformation: sie rechnet jede Bestellung in Euro um, verknüpft sie mit der Region ihrer Filiale und aggregiert die Summen.

3. Validierung: sie prüft, dass keine Region fehlt und dass die heutige Summe in einem plausiblen Bereich um die von gestern liegt. Schlägt eine Regel fehl, alarmiert sie das Data-Team und stoppt.

4. Laden: saubere, aggregierte Zahlen landen im Warehouse, und das Dashboard aktualisiert sich.

Der CFO sieht um 8 Uhr verlässliche Zahlen, ohne dass jemand eine Tabelle angefasst hat.

SourcesDatabaseAPIFilesIngestionTransformationValidationLoadingWarehouse / Dashboard
Data flows from multiple sources through ingestion, transformation, and validation, then loads into a warehouse or dashboard.

Häufige Fragen

Was ist eine Data Pipeline?

Eine Data Pipeline ist eine automatisierte Folge von Schritten, die Daten von einer Quelle (Datenbank, API, Datei, Event Stream, SaaS-Tool) zu einem Ziel wie einem Data Warehouse, einem Dashboard oder einer Anwendung bringt. Unterwegs durchlaufen sie vier Stufen: Ingestion, Transformation, Validierung und Laden. Der Punkt ist, dass die Daten sauber und nutzbar ankommen, ohne dass jemand kopiert und einfügt.

Warum sollte sich eine nicht-technische Führungskraft für Pipelines interessieren?

Weil die Pipeline die Leitungsinfrastruktur hinter jedem Dashboard, jedem Forecast und jedem KI-Feature ist, auf das Sie sich verlassen. Wenn sie unbemerkt ausfällt, driften die Zahlen und das Vertrauen ins Reporting schwindet, meist bevor es jemand merkt. Wer die vier Stufen kennt, kann die richtige Frage stellen, wenn eine Zahl falsch aussieht: war es Ingestion, Transformation, Validierung oder Laden?

Was ist der Unterschied zwischen Batch- und Streaming-Pipelines?

Eine Batch-Pipeline läuft nach Zeitplan, zum Beispiel stündlich oder nachts, und verarbeitet die angefallenen Daten in einem Durchgang. Eine Streaming-Pipeline läuft durchgehend und liefert Daten nahezu in Echtzeit. Batch passt zum täglichen Reporting wie einem Umsatz-Dashboard; Streaming passt zu Fällen, in denen eine Verzögerung von Stunden die Daten unbrauchbar machen würde.

Was passiert, wenn eine Validierungsregel während eines Pipeline-Laufs fehlschlägt?

Eine gut gebaute Pipeline stoppt und alarmiert das Data-Team, statt verdächtige Zahlen zu laden. In einem täglichen Umsatz-Dashboard prüft die Validierung etwa, dass keine Region fehlt und dass die heutige Summe in einem plausiblen Bereich um die von gestern bleibt; schlägt eine Regel fehl, hält der Lauf an, bevor sich das Dashboard aktualisiert. Genau das schützt Reports vor unbemerkt falschen Zahlen.

Was bedeutet Data Lineage und warum wird sie in Pipelines nachverfolgt?

Lineage ist die Nachvollziehbarkeit jeder Zahl: aus welcher Quelle sie kommt und welche Transformationen sie durchlaufen hat. Teams verfolgen sie, damit sie bei Zweifeln an einer Zahl oder bei einer Schema-Änderung an einer Quelle erkennen können, was neu verarbeitet werden muss und was sonst betroffen ist. Sie gehört neben dem Umgang mit Fehlern und der Kostenkontrolle zu den praktischen Themen beim Betrieb von Pipelines in Produktion.