Algorithmische Verzerrungen in Sozialleistungs- und Vollzugssystemen prüfen
# Algorithmische Verzerrungen in Sozialleistungs- und Vollzugssystemen prüfen
2021 trat die gesamte niederländische Regierung zurück. Auslöser war kein Krieg und kein Finanzcrash. Es war ein Algorithmus.
Die niederländische Steuerbehörde (Belastingdienst) hatte ein selbstlernendes Risikomodell eingesetzt, um Familien zu markieren, die sie des Betrugs bei der Kinderbetreuungsbeihilfe verdächtigte. Zehntausende Familien wurden zu Unrecht beschuldigt, zur Rückzahlung hoher Summen aufgefordert und in Schulden, Arbeitslosigkeit und teils in die Trennung von Familien getrieben. Ein überproportionaler Anteil der Markierten hatte eine doppelte Staatsangehörigkeit oder Migrationshintergrund. Die niederländische Datenschutzaufsicht stellte später fest, dass das System Staatsangehörigkeit auf diskriminierende und rechtswidrige Weise verarbeitet hatte.
Das ist der Albtraumfall für KI im öffentlichen Sektor: ein Modell, das still Verzerrungen einbaut, in großem MaMaUsing software to automate repetitive marketing tasks and campaigns, enabling personalisation at scale across channels like email, web, and social.Vollständige Definition ansehen →ßstab angewendet, auf Menschen mit wenig Möglichkeiten zum Widerspruch. Ihre Aufgabe als Führungskraft im öffentlichen Sektor ist es, dafür zu sorgen, dass das unter Ihrer Verantwortung nicht passiert.
Warum Sozialleistungs- und Vollzugssysteme hochriskant sind
Modelle im öffentlichen Sektor unterscheiden sich von kommerziellen in einem Punkt, der den Einsatz erhöht.
- Die betroffene Person kann nicht aussteigen. Wer Arbeitslosengeld verweigert bekommt, kann nicht woanders einkaufen gehen.
- Fehler potenzieren sich. Eine falsche Betrugsmarkierung kann Rückforderungen, Schäden an der Bonität und den Verlust der Wohnung auslösen.
- Historische Daten sind verzerrt. Wenn sich der Vollzug früher auf bestimmte Stadtviertel konzentriert hat, lernt ein auf dieser Historie trainiertes Modell, genau diese weiter ins Visier zu nehmen.
Der Begriff für den Schaden, den Sie prüfen, ist disparate impact: eine Regel oder ein Modell, das auf den ersten Blick neutral wirkt, aber für eine geschützte Gruppe schlechtere Ergebnisse produziert (definiert über Ethnie, nationale Herkunft, Geschlecht, Behinderung, Alter und Ähnliches). Sie müssen keine Absicht nachweisen. Sie messen das Ergebnis.
Der zentrale Test: disparate impact messen
Beginnen Sie mit einer einfachen, belastbaren Kennzahl. Zwei sind Standard.
Selection rate. Welcher Anteil jeder Gruppe hat das nachteilige Ergebnis erhalten (markiert, abgelehnt, geprüft)? Vergleichen Sie die Raten zwischen den Gruppen.
Der klassische Benchmark ist die four-fifths rule aus dem US-Arbeitsrecht: Liegt die selection rate einer geschützten Gruppe unter 80 Prozent der Rate der bestgestellten Gruppe, ist das ein Hinweis auf adverse impact, dem man nachgehen sollte. Es ist ein Screening-Instrument, kein Rechtsurteil, aber ein nützlicher Auslöser.
Hier ein minimales Audit in Python mit einer Fairness-Bibliothek:
import pandas as pd
from fairlearn.metrics import MetricFrame, selection_rate
# df hat Spalten: 'flagged' (1/0) und 'group' (z. B. Staatsangehörigkeits-Bucket)
mf = MetricFrame(
metrics=selection_rate,
y_true=df['flagged'], # tatsächliche Modellentscheidungen
y_pred=df['flagged'],
sensitive_features=df['group']
)
print(mf.by_group) # selection rate pro Gruppe
ratio = mf.by_group.min() / mf.by_group.max()
print(f"Disparate impact ratio: {ratio:.2f}") # < 0.80 => nachgehenWird Gruppe A zu 6 Prozent markiert und Gruppe B zu 20 Prozent, liegt die Ratio bei 0,30. Das liegt weit unter 0,80 und verlangt eine Erklärung.
Die selection rate reicht nicht
Eine niedrigere Markierungsrate ist nicht automatisch fair, und gleiche Markierungsraten sind es ebenso wenig. Sie müssen auch die Fehlerraten prüfen, denn der eigentliche Schaden besteht darin, *zu Unrecht* markiert zu werden.
- False positive rate: Welcher Anteil der Personen, die nichts falsch gemacht haben, wurde markiert? Werden unschuldige Mitglieder einer Gruppe doppelt so häufig markiert, ist das ein ernstes Gleichbehandlungsproblem, selbst wenn die Gesamtmarkierungsraten ausgewogen aussehen.
- False negative rate: Welcher Anteil der tatsächlichen Betrugsfälle wurde übersehen?
Im niederländischen Fall lag der tiefere Skandal bei den false positives: ehrliche Familien, die wie Betrüger behandelt wurden. Prüfen Sie immer beides.
Fairlearn ist ein kostenloses Open-Source-Toolkit, das diese Metriken berechnet, und ein vernünftiger Startpunkt für ein Audit außerhalb des Anbieters.
Proxies: die Falle, in die alle tappen
Angenommen, Sie entfernen Staatsangehörigkeit und Ethnie sicherheitshalber aus Ihrem Modell. Sie sind damit nicht auf der sicheren Seite.
Modelle rekonstruieren geschützte Merkmale aus Proxy-Variablen: Features, die mit der Gruppenzugehörigkeit korrelieren. Die Postleitzahl korreliert mit Ethnie und Einkommen. Die Korrespondenzsprache korreliert mit der nationalen Herkunft. Schreibweise des Namens, Browsersprache, selbst die "Anzahl früherer Kontakte mit der Behörde" kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen genau das Merkmal codieren, das Sie ausschließen wollten.
Das niederländische Modell behandelte Berichten zufolge doppelte Staatsangehörigkeit und niedriges Einkommen als Risikosignale. Selbst wenn ein Merkmal später entfernt wurde, kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen korrelierte Features dasselbe diskriminierende Signal weitertragen.
Praktischer Schritt: Testen Sie, ob Sie das geschützte Merkmal aus den verbleibenden Features vorhersagen kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen. Sagt ein einfaches Modell die Staatsangehörigkeit aus Ihren "neutralen" Inputs mit hoher Genauigkeit voraus, sind diese Inputs Proxies. Gehen Sie ihnen nach.
Das Audit in die Beschaffung einbauen
Die meisten Behörden bauen diese Modelle nicht. Sie kaufen sie. Damit ist Ihr stärkster Kontrollpunkt der Beschaffungsvertrag: die Bedingungen, unter denen Sie das System einkaufen.
Anbieter werden sich unter Verweis auf Geschäftsgeheimnisse gegen Offenlegung wehren. Halten Sie schriftlich dagegen, bevor Sie unterschreiben. Konkrete Klauseln, die Sie verlangen sollten:
- Offenlegung von Bias-Tests. Der Anbieter muss Aufschlüsselungen der selection rate und der Fehlerraten nach geschützten Gruppen für Ihre Population liefern, nicht einen generischen Benchmark.
- Beschreibung der Trainingsdaten. Woher die Daten stammen, welchen Zeitraum sie abdecken und welche Lücken oder Schieflagen bekannt sind.
- Auditrecht. Sie (oder ein unabhängiger Dritter) kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen das Modell auf zurückgehaltenen Daten testen, inklusive Zugriff auf Inputs und Outputs.
- Anforderung an Erklärbarkeit. Für jede nachteilige Entscheidung muss das System eine für Menschen lesbare Begründung liefern.
- Garantie für human-in-the-loop. Keine vollautomatisierte nachteilige Entscheidung ohne geschulte Sachbearbeitung, die sie überstimmen kann.
- Benachrichtigung bei Updates. Der Anbieter muss Sie informieren, wenn sich das Modell ändert, denn ein neu trainiertes Modell kann neue Verzerrungen einführen.
Der EU AI Act stuft Systeme, die über den Zugang zu öffentlichen Leistungen und Diensten entscheiden, als hochriskant ein, was Pflichten zu Risikomanagement, Data GovernanceData GovernanceData governance is the set of policies, roles, and processes that ensure data is accurate, secure, well-defined, and used responsibly across an organization.Vollständige Definition ansehen →, Transparenz und menschlicher Aufsicht auslöst. Wenn Sie in der EU tätig sind oder in die EU verkaufen, sind diese 2026 nicht optional. Auch außerhalb der EU sind sie eine solide Grundlinie.
🎬 [VIDEO: "The Dutch benefits scandal explained" - youtube.com - ein kompakter Überblick, wie der Algorithmus zur Kinderbetreuungsbeihilfe massenhaft Schaden anrichtete]
Governance: wer die Verantwortung trägt
Ein Audit ist nur so gut wie die Autorität dahinter. Richten Sie das vor dem Rollout ein.
- Eine namentlich benannte menschliche Verantwortung für das Modell, rechenschaftspflichtig für dessen Entscheidungen. Nicht "der Algorithmus hat entschieden".
- Ein Widerspruchsweg, der schnell ist und keinen Anwalt erfordert. Im niederländischen Fall kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →ämpften Familien jahrelang darum, ihren Namen reinzuwaschen.
- Logging. Erfassen Sie jede Entscheidung, die Inputs und den Score, damit Sie rekonstruieren kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen, was passiert ist, wenn jemand widerspricht.
- Regelmäßige Re-Audits. Bias verschiebt sich, wenn sich Populationen und Daten ändern. Prüfen Sie nach Zeitplan, nicht einmalig.
Wissenscheck
1. Was ist das bestimmende Merkmal von "disparate impact" im Kontext von Audits algorithmischer Verzerrungen?
2. Warum erfordert die Prüfung auf disparate impact KEINEN Nachweis einer Diskriminierungsabsicht?
3. Ein Modell, das auf historischen Vollzugsdaten trainiert wurde, die stark auf bestimmte Stadtviertel abzielten, markiert weiterhin genau diese Viertel. Welches Risiko von KI im öffentlichen Sektor veranschaulicht das am besten?
4. Wählen Sie ALLE korrekten Antworten dazu, warum Sozialleistungs- und Vollzugssysteme im Vergleich zu kommerzieller KI als besonders hochriskant gelten.
Wählen Sie alle richtigen Antworten aus.
5. Wählen Sie ALLE korrekten Antworten zur Metrik selection rate und zur four-fifths rule.
Wählen Sie alle richtigen Antworten aus.
Ein kurzes durchgerechnetes Szenario
Ihre Behörde setzt ein Modell ein, um zu priorisieren, welche Leistungsanträge eine manuelle Betrugsprüfung erhalten. Nach drei Monaten ziehen Sie die Logs.
Sie finden:
- Antragstellende aus Bezirken mit hohem Migrationsanteil werden zu 18 Prozent markiert; andere Bezirke zu 7 Prozent. Ratio: 0,39.
- Die false positive rate der stärker markierten Gruppe liegt bei 22 Prozent gegenüber 9 Prozent bei den anderen.
Was tun Sie?
1. Schalten Sie die Prüfung nicht komplett ab. Das kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnte echten Betrug durchlassen und ist ein eigenes Versagen.
2. Spüren Sie den Treiber auf. Welche Features treiben den Score bei markierten Gruppen nach oben? Oft ist es ein Proxy wie die Postleitzahl oder "unvollständige Unterlagen", was mit Sprachbarrieren korreliert, nicht mit Betrug.
3. Testen Sie eine Version ohne die verdächtigen Features und vergleichen Sie die Betrugserkennung. Verlieren Sie kaum Erkennung, senken aber die Disparität deutlich, hat das Feature Bias-Arbeit geleistet, keine Betrugserkennung.
4. Führen Sie eine menschliche Prüfschwelle ein. Keine Rückforderung ohne Freigabe durch die Sachbearbeitung und eine schriftliche Begründung, die die antragstellende Person einsehen kann.
5. Dokumentieren Sie alles für Ihre Aufsicht und Ihr Widerspruchsverfahren.
Das ist der Unterschied zwischen einem belastbaren System und einem Skandal: Sie haben gemessen, nachverfolgt, korrigiert und kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Ihre Arbeit belegen.
Wichtigste Erkenntnisse
- Messen Sie Ergebnisse, nicht Absichten. Berechnen Sie selection rates und vor allem false positive rates über geschützte Gruppen hinweg. Die four-fifths-Ratio (0,80) ist ein Screening-Auslöser, kein Urteil.
- Geschützte Merkmale zu entfernen entfernt nicht den Bias. Proxy-Variablen wie Postleitzahl und Sprache rekonstruieren ihn. Testen Sie, ob Ihre "neutralen" Features das geschützte Merkmal vorhersagen.
- Die Beschaffung ist Ihr Hebel. Verlangen Sie Bias-Offenlegungen, Auditrechte, Erklärbarkeit und menschliche Übersteuerung im Vertrag, bevor Sie unterschreiben.
- Halten Sie eine Person verantwortlich und einen schnellen Widerspruchsweg offen. Die Grausamkeit des niederländischen Skandals lag in den Jahren, in denen Familien dem Urteil einer Maschine nichts entgegensetzen konnten.
- Prüfen Sie nach Zeitplan. Neu trainierte Modelle driften. Ein System, das letztes Jahr fair war, muss es heute nicht mehr sein.