KI-Anbieter anhand von Vergabekriterien der öffentlichen Hand bewerten
# KI-Anbieter anhand von Vergabekriterien der öffentlichen Hand bewerten
Eine regionale Wohnungsbehörde erhält auf eine RFP (Request for Proposal) die Antwort eines KI-Anbieters, der verspricht, die Prüfung der Anspruchsberechtigung und die Fallsortierung für 40.000 Mieterakten zu automatisieren. Im Deck steht „99 % Genauigkeit" und „enterprise-grade security". Der zuständige Einkäufer hat dreißig Minuten, um zu entscheiden, ob diese Behauptung einem Security-Audit standhält. Diese Lektion ist diese dreißig Minuten.
Warum die Beschaffung im öffentlichen Sektor anders funktioniert
Private Unternehmen kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen ein KI-Tool per Handschlag und Bestellschein pilotieren. Öffentliche Stellen kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen das nicht. Die meisten KI-Beschaffungen im US-amerikanischen öffentlichen Sektor müssen formale Vergaberegeln durchlaufen: IT-Sicherheitsstandards der Bundesstaaten, die föderalen FedRAMP-Anforderungen für Cloud-Dienste, die Bundesdaten berühren, und zunehmend KI-spezifische Vergaberichtlinien auf Ebene der Bundesstaaten (Kalifornien, Texas und Connecticut haben mit Stand 2025 jeweils eigene Leitlinien zur KI-Beschaffung veröffentlicht).
FedRAMP (Federal Risk and Authorization Management Program) ist das standardisierte Verfahren der US-Regierung zur Bewertung und Zulassung von Cloud-Produkten für den Einsatz auf Bundesebene. Ist das Produkt eines Anbieters nicht FedRAMP-autorisiert und berührt der Use Case Bundesdaten (z. B. HUD-finanzierte Wohnprogramme), ist das ein Ausschlusskriterium, kein Verhandlungsdetail. Prüfen Sie den FedRAMP Marketplace direkt, statt der Folie eines Anbieters zu vertrauen.
Behörden auf Ebene der Bundesstaaten und Kommunen nutzen häufig parallele Frameworks wie StateRAMP, das auf ähnlichen Prinzipien für Cloud-Beschaffungen von Bundesstaaten und Kommunen aufbaut.
Der Punkt: Vergabekriterien sind keine bürokratische Reibung. Sie sind der Mechanismus, mit dem eine Behörde verhindert, Bürgerdaten (Aufenthaltsstatus, Einkommen, Behinderungsnachweise) in ein System zu geben, das keinen Accountability-Trail hinterlässt.
Die RFP-Behauptung, entschlüsselt
Hier eine verdichtete Version einer realistischen Anbieteraussage, gefolgt von dem, was ein scharfer Evaluator fragt.
> „Unsere KI-Plattform erreicht 99 % Genauigkeit bei der Feststellung der Anspruchsberechtigung und nutzt enterprise-grade Verschlüsselung. Wir sind SOC-2-konform und genießen das Vertrauen führender Organisationen."
Vier Behauptungen, vier Rückfragen:
1. „99 % Genauigkeit", Genauigkeit wobei, wie gemessen?
Genauigkeit ohne definierte Aufgabe und definierten Datensatz ist bedeutungslos. Fragen Sie: Genauigkeit gemessen an welcher Ground Truth? Bei welcher Population? Ein Modell, das auf einem vom Anbieter kuratierten Trainingsset 99 % Genauigkeit erreicht, sagt nichts über die Leistung beim tatsächlichen Antragsteller-Mix Ihrer Wohnungsbehörde aus, der Menschen ohne Englischkenntnisse, Vorkehrungen bei Behinderungen oder ungewöhnliche Haushaltskonstellationen umfassen kann. Verlangen Sie die Confusion Matrix (eine Tabelle mit korrekten vs. falschen Vorhersagen je Kategorie), nicht nur eine einzelne Zahl.
2. „Enterprise-grade Verschlüsselung", ist das ein echter Standard oder Marketingsprache?
„Enterprise-grade" ist keine Zertifizierung. Fragen Sie konkret: Werden Daten at rest und in transit mit AES-256 verschlüsselt (ein konkreter, benannter Verschlüsselungsstandard)? Liegt das Key Management bei der Behörde oder beim Anbieter? Vage Adjektive sollten immer in einen benannten, überprüfbaren Standard übersetzt werden.
3. „SOC-2-konform", konform oder lediglich auditiert?
SOC 2 (System and Organization Controls 2, ein Audit-Framework des American Institute of CPAs) kennt zwei Berichtstypen. Type I prüft, ob Kontrollen zu einem Stichtag existieren. Type II prüft, ob die Kontrollen über einen Zeitraum (üblicherweise 6 bis 12 Monate) tatsächlich wirksam funktioniert haben. Type I ist ein deutlich schwächeres Signal. Fragen Sie nach dem Typ, fordern Sie den Bericht an und fragen Sie, wann ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → ausläuft.
4. „Vertrauen führender Organisationen", ist das relevanter Social Proof?
Ein Anbieter, dem Einzelhandelsketten bei der Bestandsprognose vertrauen, sagt nichts über seine Eignung für den Umgang mit geschützten Mieterdaten unter den Programmregeln von HUD (Department of Housing and Urban Development). Fragen Sie gezielt nach Referenzen aus dem öffentlichen Sektor, idealerweise andere Wohnungsbehörden oder HUD-Zuwendungsempfänger, und rufen Sie dort an.
Ein Scoring-Framework für die Beschaffung
Bewerten Sie jede Anbieterantwort über vier Dimensionen, nicht nur über Preis und Features.
| Kriterium | Was zu prüfen ist | Ausschließendes Red Flag |
|---|---|---|
| Sicherheitszertifizierung | FedRAMP-/StateRAMP-Autorisierungsstatus, SOC-2-Type-II-Bericht | Nur „SOC 2 in Arbeit" oder kein Bericht verfügbar |
| Datenstandort und Eigentum | Wo Daten gespeichert werden, wer zugreifen kann, Vertragsklauseln zur Datenlöschung | Anbieter behält sich Rechte vor, Behördendaten zum Training von Modellen für andere Kunden zu nutzen |
| Nachweise zu Genauigkeit und Bias | Unabhängige Tests, Aufschlüsselung nach demografischen Subgruppen | Keine Validierung durch Dritte, nur vom Anbieter berichtete Zahlen |
| Erklärbarkeit | KKThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Mitarbeitende sehen, warum das Modell einen Fall zur Ablehnung oder Prüfung markiert hat | „Black Box"-Modell ohne fallbezogene Begründung, besonders bei nachteiligen Entscheidungen |
Die letzte Zeile zählt im Wohnungsbereich besonders. Nach den auf Leistungsentscheidungen angewandten Due-Process-Grundsätzen hat eine Person, der Wohnhilfe verweigert wird, grundsätzlich ein Recht darauf zu verstehen, warum. Ein Modell, das für eine Ablehnung keine menschenlesbare Begründung liefern kann, erzeugt rechtliches Risiko, egal wie genau es im Durchschnitt ist. Das ist dieselbe Logik wie hinter dem NIST AI Risk Management Framework, das Erklärbarkeit und Accountability als zentrale Vertrauensanforderungen behandelt, nicht als Nice-to-have.
Eine minimale technische Prüfung, die jeder anfordern kann
Sie müssen kein Data Scientist sein, um das zu verlangen. Fordern Sie, dass der Anbieter die Genauigkeit nach Subgruppen aufgeschlüsselt berichtet, nicht nur insgesamt. Ein einfacher Sanity-Check auf Disparate Impact:
Overall accuracy: 91%
Accuracy for English-speaking applicants: 94%
Accuracy for Spanish-speaking applicants: 78%Eine Lücke von 16 Punkten wie hier ist ein Red Flag, unabhängig von der Headline-Zahl. Sie deutet darauf hin, dass eine Gruppe in den Trainingsdaten unterrepräsentiert war, was im Kontext der Wohnberechtigung eine Prüfung nach dem Fair Housing Act auslösen kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnte, der von HUD durchgesetzt wird. Jeder Evaluator, technisch versiert oder nicht, kann darauf bestehen, diese Tabelle zu sehen, bevor der Abschnitt „Genauigkeit" einer RFP-Antwort bewertet wird.
Wissenscheck
1. Das KI-Tool eines Anbieters zur Prüfung der Anspruchsberechtigung wird Daten aus einem HUD-finanzierten Wohnprogramm verarbeiten, ist aber nicht im FedRAMP Marketplace gelistet. Was ist die richtige vergaberechtliche Schlussfolgerung?
2. Warum kann eine öffentliche Wohnungsbehörde das Tool eines vielversprechenden KI-Anbieters nicht einfach so pilotieren wie ein Privatunternehmen, per Handschlagvereinbarung?
3. Ein Anbieter behauptet „99 % Genauigkeit" bei der Feststellung der Anspruchsberechtigung für das Mieterscreening einer Wohnungsbehörde. Was sollte ein scharfer Evaluator mit dieser Behauptung tun?
4. Wählen Sie ALLE korrekten Antworten zu Frameworks und Standards, die für die KI-Beschaffung im öffentlichen Sektor relevant sind.
Wählen Sie alle richtigen Antworten aus.
5. Wählen Sie ALLE korrekten Antworten dazu, warum ein Einkäufer Anbieterbehauptungen unabhängig prüfen sollte, statt sich auf die Unterlagen des Anbieters zu verlassen.
Wählen Sie alle richtigen Antworten aus.
ROIROIReturn on Investment: the ratio of net profit to the cost of an investment. A 300% ROI means each dollar invested returns $3.Vollständige Definition ansehen →: was „Erfolg" tatsächlich bedeuten sollte
Anbieter verkaufen ROIROIReturn on Investment: the ratio of net profit to the cost of an investment. A 300% ROI means each dollar invested returns $3.Vollständige Definition ansehen → über eingesparte Personalstunden oder bearbeitete Fälle pro Woche. Behandeln Sie diese Zahlen als Hypothesen, nicht als Fakten, bis sie in einem Piloten validiert sind.
Ein realistischeres ROIROIReturn on Investment: the ratio of net profit to the cost of an investment. A 300% ROI means each dollar invested returns $3.Vollständige Definition ansehen →-Framework für eine Behörde:
- Zuerst die Baseline. Messen Sie die aktuelle durchschnittliche Zeit bis zur Entscheidung und die Fehlerquote, bevor ein KI-Tool eingeführt wird. Ohne das ist „40 % schneller" nicht überprüfbar.
- Pilot auf einer begrenzten Population. Lassen Sie das Tool auf einer Teilmenge laufen (z. B. eine Regionalstelle, 90 Tage), bevor es behördenweit ausgerollt wird. Das ist gängige Praxis und wird in der KI-Guidance der GSA für Bundesbehörden empfohlen.
- Rechnen Sie mit Total Cost of Ownership, nicht mit dem Lizenzpreis. Berücksichtigen Sie Nachschulung der Mitarbeitenden, Integration in bestehende Fallmanagement-Systeme und den Audit-/Compliance-Aufwand, um die FedRAMP- oder StateRAMP-Posture über die Vertragslaufzeit aufrechtzuerhalten. Behörden unterschätzen die Integrationskosten regelmäßig; Analysten schätzen (laut Branchenkommentaren 2024 bis 2025), dass diese in legacy-lastigen Umgebungen wie Wohnungsbehörden die Softwarelizenzkosten erreichen oder übersteigen kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen.
- Verfolgen Sie Widersprüche und Aufhebungen. Wenn KI-gestützte Ablehnungen im Widerspruchsverfahren häufiger aufgehoben werden als rein menschliche Entscheidungen, sind das versteckte Kosten, die die Genauigkeitsfolie nie zeigt.
🎬 [VIDEO: „How Government Buys Software (and Why It's So Hard)" - youtube.com - ein Durchgang durch die Beschaffungszyklen im öffentlichen Sektor und warum Compliance-Anforderungen die Anbieterauswahl stärker prägen als Features]
Wichtigste Erkenntnisse
- Akzeptieren Sie Anbieterbehauptungen wie „99 % Genauigkeit" oder „enterprise-grade security" nie ungeprüft. Übersetzen Sie jede Marketingphrase in einen konkreten, überprüfbaren Standard (SOC 2 Type II, AES-256, FedRAMP-Autorisierungsnummer).
- Bestätigen Sie den FedRAMP- oder StateRAMP-Status direkt im offiziellen Marketplace, nicht über die Unterlagen des Anbieters.
- Verlangen Sie Genauigkeitsdaten auf Subgruppen-Ebene, nicht nur eine aggregierte Zahl, um Disparate Impact zu erkennen, bevor daraus ein Fair-Housing- oder Bürgerrechtsproblem wird.
- Erklärbarkeit ist bei Leistungs- und Anspruchsentscheidungen nicht optional. Wenn das Tool keine fallbezogene Begründung liefern kann, hält es einem Widerspruch oder einer Due-Process-Anfechtung möglicherweise nicht stand.
- Berechnen Sie den ROIROIReturn on Investment: the ratio of net profit to the cost of an investment. A 300% ROI means each dollar invested returns $3.Vollständige Definition ansehen → gegen eine gemessene Baseline und die vollen Integrationskosten, nicht allein gegen die vom Anbieter prognostizierten Zeitersparnisse. Pilotieren, bevor Sie skalieren.