+150 XP

Data-Quality-Scorecards für Behördendatensätze

# Data-Quality-Scorecards für Behördendatensätze

Eine Sachbearbeiterin in einer bundesstaatlichen Medicaid-Behörde ruft einen Report ab: 40.000 Haushalte sind bei der Leistungsverlängerung als "over income" markiert. Bevor irgendjemand einen Kündigungsbescheid verschickt, sollte jemand fragen: Wie viele dieser 40.000 Zeilen haben veraltete Adressen, fehlende Einkommensfelder oder doppelte Fall-IDs aus einer Systemmigration vor drei Jahren? 2023 haben mehrere US-Bundesstaaten die Medicaid-Listen mit automatisierten Anspruchsprüfungen bereinigt, nachdem die Schutzregelungen aus der Pandemiezeit endeten, und investigative Recherchen (siehe KFFs Tracking des Medicaid Unwinding) ergaben, dass viele Leistungsstreichungen auf Papierkram- und Datenfehler zurückgingen, nicht auf tatsächlich fehlende Ansprüche. Das ist ein Data-Quality-Versagen mit realen menschlichen Folgen.

Diese Lektion baut ein praktisches Werkzeug für genau diesen Moment: eine Scorecard, die Ihnen sagt, ob ein Behördendatensatz vertrauenswürdig genug ist, um darauf zu handeln.

Warum Datenqualität ein Governance-Thema ist und nicht nur ein IT-Thema

In der Verwaltung kosten Data-Quality-Versagen nicht nur Geld. Sie können jemandem eine Leistung verweigern, Notfallressourcen fehlleiten oder eine Politik erzeugen, die auf einer Fiktion beruht.

Data Quality bezeichnet die Frage, ob ein Datensatz für seinen vorgesehenen Zweck geeignet ist. Üblicherweise wird sie über vier bis sechs Dimensionen bewertet. Wir konzentrieren uns auf die vier, die für Analysten im öffentlichen Sektor am praktikabelsten sind:

  • Completeness (Vollständigkeit): Sind die erforderlichen Felder gefüllt?
  • Accuracy (Korrektheit): Spiegeln die Daten die reale Wirklichkeit wider?
  • Timeliness (Aktualität): Sind die Daten aktuell genug, um relevant zu sein?
  • Consistency (Konsistenz): Stimmen die Daten mit sich selbst und mit anderen Systemen überein?

Das deckt sich weitgehend mit dem Framework, das das US Government Accountability Office (GAO), die Bundesrechnungsprüfungsbehörde, in seinen Data-Reliability-Assessments für Programmprüfungen verwendet.

Die Scorecard bauen: eine Datei zur Leistungsberechtigung

Stellen Sie sich die Berechtigungsdatei eines Bundesstaats für das Supplemental Nutrition Assistance Program (SNAP, das US-Bundesprogramm zur Lebensmittelhilfe) vor: 100.000 Zeilen, eine Zeile pro Haushalt, genutzt für die Entscheidung, wer automatisch verlängert wird.

Dimension 1: Completeness

Anteil der erforderlichen Felder, die über die kritischen Variablen hinweg nicht null sind (Einkommen, Haushaltsgröße, Adresse, Datum der letzten Verifizierung).

Rechenbeispiel:

  • Einkommensfeld gefüllt: 96.000 / 100.000 = 96 %
  • Haushaltsgröße gefüllt: 99.500 / 100.000 = 99,5 %
  • Datum der letzten Verifizierung gefüllt: 88.000 / 100.000 = 88 %

Completeness-Score = Durchschnitt der kritischen Felder = (96 + 99,5 + 88) / 3 = 94,5 %

Ein verbreiteter Benchmark im öffentlichen Sektor: Felder, die direkt in die Anspruchsfeststellung eingehen, sollten über 98 % Vollständigkeit liegen, bevor automatisierte Entscheidungen darauf gestützt werden. Darunter: zur manuellen Prüfung markieren.

Dimension 2: Accuracy

Schwerer direkt zu messen; üblicherweise über eine Stichprobenprüfung gegen eine Source of Truth geschätzt (Lohnabrechnungen, Arbeitgeberdaten, ein Cross-Match mit Lohndatenbanken).

Rechenbeispiel: Prüfer ziehen eine Zufallsstichprobe von 500 Datensätzen und verifizieren das Einkommen gegen das Lohnmeldesystem des Bundesstaats.

  • Datensätze, die innerhalb einer vertretbaren Toleranz übereinstimmen: 465 / 500 = 93 % Accuracy-Rate

Bei Berechtigungsdaten mit hohen Konsequenzen behandeln viele Prüfstandards (im Einklang mit GAO-Leitlinien) alles unter 95 % Accuracy als nicht ausreichend belastbar für automatisierte belastende Maßnahmen (Ablehnungen, Streichungen) ohne menschliche Prüfung.

Dimension 3: Timeliness

Wie aktuell sind die Daten im Verhältnis zum Zeitpunkt ihrer Nutzung?

Rechenbeispiel: Haushalte sollen alle 12 Monate neu verifiziert werden.

  • In den letzten 12 Monaten verifiziert: 82.000 / 100.000 = 82 % aktuell
  • 18.000 Datensätze haben Verifizierungsdaten, die über 12 Monate alt sind, das heißt Einkommens- oder Haushaltsveränderungen sind möglicherweise nicht erfasst.

Dimension 4: Consistency

Stimmen die Werte über Systeme hinweg oder innerhalb der Datei überein? Gängiger Check: Stimmt die Haushaltsgröße im Berechtigungssystem mit der Haushaltsgröße im verknüpften Steuer- oder Lohnsystem überein?

Rechenbeispiel:

  • Match-Rate über Systeme: 91.000 / 100.000 = 91 % konsistent
  • Die 9 % Abweichung können reale Haushaltsveränderungen widerspiegeln (eine Geburt, ein Umzug) oder einen Sync-Fehler zwischen zwei IT-Systemen, ein häufiges Problem, wenn Legacy-Mainframes neuere Case-Management-Software beliefern.

Die Scorecard zusammensetzen

| Dimension | Score | Schwelle für automatisierte Entscheidungen | Pass/Fail |

|---|---|---|---|

| Completeness | 94,5 % | 98 % | Fail |

| Accuracy | 93 % | 95 % | Fail |

| Timeliness | 82 % | 90 % | Fail |

| Consistency | 91 % | 95 % | Fail |

Gesamturteil: Dieser Datensatz fällt in drei von vier Dimensionen gegen vertretbare Schwellen für automatisierte Maßnahmen mit hohen Konsequenzen durch. Für aggregierte Politikanalysen (Schätzung von Fallzahltrends) kann er weiterhin nutzbar sein, sollte aber ohne eine Human-in-the-Loop-Prüfebene keine individuellen Streichungsentscheidungen steuern.

Das ist die zentrale Abwägung dieser Lektion: Derselbe Datensatz kann für einen Zweck "gut genug" und für einen anderen gefährlich sein. Eine Scorecard gibt Ihnen kein einzelnes Urteil, sie gibt Ihnen ein Urteil pro Use Case.

Ein einfaches Scoring-Snippet

python
import pandas as pd

def completeness(df, cols):
    return df[cols].notna().mean().mean() * 100

def timeliness(df, date_col, months_allowed=12, as_of=pd.Timestamp("2026-01-01")):
    cutoff = as_of - pd.DateOffset(months=months_allowed)
    return (df[date_col] >= cutoff).mean() * 100

critical_fields = ["income", "household_size", "last_verified"]
score_completeness = completeness(df, critical_fields)
score_timeliness = timeliness(df, "last_verified")

print(f"Completeness: {score_completeness:.1f}%")
print(f"Timeliness: {score_timeliness:.1f}%")

Monatlich laufen lassen, den Trend plotten, und Sie erkennen Verschlechterungen, bevor daraus ein Skandal wird.

Wissenscheck

1. Warum wird das Medicaid-Unwinding-Beispiel als Data-Quality-Versagen dargestellt und nicht einfach als politisches Ergebnis?

2. Eine Sachbearbeiterin stellt fest, dass das Einkommensfeld eines Haushalts gefüllt ist, aber einen Job abbildet, den die Person vor zwei Jahren verlassen hat. Welche Data-Quality-Dimension ist am direktesten verletzt?

3. Warum stellt die Lektion Datenqualität als Governance-Thema dar und nicht als rein technisches IT-Thema?

MEHRFACHAUSWAHL

4. Wählen Sie ALLE richtigen Antworten zu den vier Kerndimensionen der Datenqualität, die in der Lektion beschrieben werden.

Wählen Sie alle richtigen Antworten aus.

MEHRFACHAUSWAHL

5. Wählen Sie ALLE richtigen Antworten dazu, warum ein Analyst eine Data-Quality-Scorecard erstellen sollte, bevor er auf einen Behördendatensatz wie eine Berechtigungsdatei hin handelt.

Wählen Sie alle richtigen Antworten aus.

Governance: wem gehören die Schwellenwerte?

Schwellenwerte (98 % Completeness, 95 % Accuracy usw.) sind keine Naturgesetze, sie sind politische Entscheidungen, und jemand muss sie verantworten.

In den USA formalisieren Behörden das zunehmend über Data-Governance-Boards, geprägt vom Foundations for Evidence-Based Policymaking Act (2018), der Bundesbehörden verpflichtet, Chief Data Officers zu benennen und Dateninventare sowie Qualitätspläne aufzubauen. Die Federal Data Strategy des OMB setzt behördenübergreifend Erwartungen an Data-Quality-Praktiken.

In der EU drängen der Data Governance Act (2022) und nationale Open-Data-Gesetze öffentliche Stellen zu dokumentierten Datenqualitätsstandards, insbesondere für Datensätze, die zur Weiterverwendung bereitgestellt werden. Eurostat, das Statistikamt der EU, veröffentlicht ein eigenes Quality-Assurance-Framework mit Dimensionen, die den vier oben genannten nahezu entsprechen, plus "Kohärenz" und "Zugänglichkeit".

Die praktische Lehre: Bevor Sie einer Scorecard vertrauen, fragen Sie, wer die Pass/Fail-Schwellen gesetzt hat und ob sie auf die konkrete Entscheidung kalibriert waren (eine Leistungsstreichung) oder auf eine mit geringeren Konsequenzen (ein öffentliches Dashboard).

Wenn "gut genug" nicht gut genug ist

Ein Datensatz kann jede technische Schwelle bestehen und Sie dennoch in die Irre führen, wenn er systematisch verzerrt ist. Beispiel: Wenn Ansprache und Neuverifizierung häufiger in städtischen Countys mit besserem Breitband stattfinden, zeigen ländliche Haushalte künstlich schlechte Timeliness-Scores, die Infrastrukturlücken widerspiegeln, nicht das Verhalten der Haushalte. Kombinieren Sie die Scorecard immer mit einer Aufschlüsselung nach Subgruppen (Region, Sprache, Alter), bevor Sie sie für Politik nutzen.

🎬 [VIDEO: "Data Quality Dimensions Explained" - https://www.youtube.com/results?search_query=data+quality+dimensions+explained - Suchergebnisse für verständliche Erklärvideos zu den Frameworks Completeness, Accuracy, Timeliness und Consistency, die im öffentlichen und privaten Sektor verwendet werden]

Wichtigste Erkenntnisse

  • Eine Data-Quality-Scorecard sollte mindestens vier Dimensionen messen: Completeness, Accuracy, Timeliness, Consistency, jede mit einem konkreten Prozentwert und einer expliziten Schwelle, die an die zu treffende Entscheidung gebunden ist.
  • Derselbe Datensatz kann für aggregierte Analysen geeignet und für individuelle Entscheidungen mit hohen Konsequenzen wie Leistungsstreichungen ungeeignet sein; beziehen Sie Ihr Urteil immer auf den Use Case.
  • Schwellenwerte sind politische Entscheidungen, keine Naturgesetze. In den USA drängen der Evidence-Based Policymaking Act und die Federal Data Strategy des OMB Behörden zu formalen Datenqualitätsplänen; in der EU spielen der Data Governance Act und das Quality-Framework von Eurostat eine ähnliche Rolle.
  • Das Bestehen technischer Schwellen schließt systemische Verzerrung nicht aus. Schlüsseln Sie Scores immer nach Subgruppen auf (Region, Demografie, Kanal), bevor Sie einem aggregierten Score vertrauen.
  • Bauen Sie Scorecards als wiederkehrende, automatisierte Checks, nicht als einmalige Audits, damit Verschlechterungen erkannt werden, bevor sie zu einer fehlerhaften politischen Entscheidung führen.

Verwandte Artikel

Aktuelle Blogartikel, die auf dieser Lektion aufbauen.