KIAI in BankingBankingFintech

SR 11-7 beißt immer noch, und Gradient Boosting hat die Wunde vergrößert

SR 11-7 wurde für logistische Regression geschrieben, doch Banken bringen heute Gradient Boosting, neuronale Netze und Scoring auf Basis von Foundation Models in Produktion. Dieser Beitrag klärt, was Explainability unter der Guidance tatsächlich bedeutet, warum Prüfer 2026 stärker darauf drängen und wo die Governance-Frameworks wirklich versagen.

Neo NeumannNeo NeumannAI Practice Lead25. September 2026

Es geht um Model Explainability als Compliance-Pflicht, nicht als technische Vorliebe. Banken bauen seit Jahren Tooling für Explainability auf, meist um interne Model-Risk-Komitees zufriedenzustellen und gelegentlich die Anforderungen an eine Adverse Action Notice nach dem Equal Credit Opportunity Act zu erfüllen. Geändert haben sich die Intensität der Prüfungen, die Komplexität der Modelle, die inzwischen in Produktion laufen, und die unbequeme Lücke zwischen dem, was SHAP-Werte einem Prüfer sagen, und dem, was das Modell tatsächlich tut.

SR 11-7, die 2011 von Federal Reserve und OCC veröffentlichte Guidance, liegt ein Jahrzehnt vor Transformer-Architekturen, Gradient-Boosting-Frameworks und der aktuellen Generation LLM-gestützter Kredit-Tools. Ersetzt wurde sie aber nicht. Prüfer wenden sie auf Modelle an, die sich ihre Autoren nie vorgestellt haben.

Modellrisiko trifft Risikovorsorge, Basel-III-Kapital und Consent Orders

Das Kreditportfolio einer Bank wird auf Annahmen über Ausfallwahrscheinlichkeiten bepreist. Diese Annahmen stecken in Modellen. Wenn ein Modell sich danebenbenimmt, bleibt der Verlust nicht im Posteingang des Model-Risk-Management-Teams (MRM). Er fließt in Risikovorsorge, in Kapitalanforderungen nach Basel III und, falls das Modell diskriminierende Entscheidungen getroffen hat, in Consent Orders mit der CFPB oder dem DOJ.

Das Update des Model-Risk-Management-Handbuchs der OCC von 2023 stellte klar, dass „conceptual soundness“ erfordert, nicht nur erklären zu können, was ein Modell vorhersagt, sondern warum es das vorhersagt und ob diese Begründung mit dem beabsichtigten Einsatz der Bank vereinbar ist. Für ein Gradient-Boosting-Modell im Mortgage Underwriting ist „mit dem beabsichtigten Einsatz vereinbar“ ein sehr anspruchsvoller Maßstab, wenn das Modell aus historischen Daten gelernt hat, die jahrzehntelange diskriminierende Kreditvergabemuster abbilden.

Aufsichtsbehörden schauen auch darauf, wie Banken Modelle von Dritten einsetzen. JPMorgan Chase, Wells Fargo und Bank of America nutzen alle Scoring-Modelle von Anbietern für Teile ihrer Kreditentscheidungen. Unter SR 11-7 trägt die Bank das Modellrisiko, unabhängig davon, wer das Modell gebaut hat. Kann der Anbieter kein Model Fact Sheet liefern, das einem Prüfer genügt, steht die Bank dafür gerade.

Über Kredit hinaus erfordert , Modellrisiken zu erkennen, bevor sie eine aufsichtsrechtliche Maßnahme auslösen , dass Banken dieselbe Explainability-Logik auf AML-Transaktionsmonitoring, Betrugserkennung und zunehmend auf LLM-gestützte Tools in Compliance-Workflows anwenden. Ein LLM, das Verdachtsmeldungen generiert, seine Argumentationskette aber nicht darlegen kann, ist nach der Logik von SR 11-7 ein unerklärtes Modell, auf dessen Outputs sich die Bank stützt.

Was verlangt SR 11-7 konkret an Explainability?

SR 11-7 verwendet das Wort „Explainability“ nicht. Verlangt werden conceptual soundness, laufendes Monitoring und eine Dokumentation, die einer „knowledgeable party“ die Bewertung des Modells erlaubt. In der Praxis haben MRM-Teams das als drei Dinge ausgelegt:

Erstens braucht das Modell ein dokumentiertes konzeptionelles Narrativ: eine Darstellung in klarer Sprache, warum der gewählte Ansatz für den beabsichtigten Einsatz geeignet ist, auf welchen Annahmen er beruht und was diese Annahmen widerlegen würde. Für eine logistische Regression ist das unkompliziert. Für ein XGBoost-Modell mit 400 Features braucht es Disziplin.

Zweitens müssen einzelne Vorhersagen auf Entscheidungsebene erklärbar sein, besonders bei Adverse Actions. Fair Housing Act und ECOA verlangen, dass abgelehnte Antragsteller konkrete Gründe erhalten. Post-hoc-Erklärungstools wie SHAP (SHapley Additive exPlanations) weisen jedem Feature pro Vorhersage Beitragswerte zu und geben der Bank damit eine Grundlage, diese Gründe zu erzeugen. Aber SHAP-Erklärungen approximieren das Verhalten des Modells; sie beschreiben es nicht exakt. Wenn ein CFPB-Prüfer fragt, ob die erzeugten Reason Codes korrekt sind, lautet die ehrliche Antwort „näherungsweise, innerhalb definierter Toleranzgrenzen“, und die Bank braucht Dokumentation, die zeigt, dass diese Grenzen validiert wurden.

Drittens muss das Monitoring erkennen, wenn sich die Erklärungsstruktur selbst verschoben hat. Wurde ein Modell mit dem Immobilienwert als zweitstärkstem SHAP-Beitrag freigegeben und hat sechs Monate später ein geografisches Cluster-Feature diesen verdrängt, ist das eine wesentliche Änderung, die eine Modellüberprüfung auslösen sollte. Viele Banken fahren dieses Monitoring quartalsweise. Angesichts der Geschwindigkeit, mit der sich Datenverteilungen verschieben können, ist dieser Takt zunehmend unzureichend.

Ein konkretes Beispiel: 2024 stellte eine mittelgroße Regionalbank im Südosten der USA während einer Fair-Lending-Prüfung fest, dass ihr auf LightGBM gebautes Pricing-Modell für Autokredite die Postleitzahl als Top-5-Feature nutzte. Intern war das Modell mit der Begründung freigegeben worden, die Postleitzahl sei ein Proxy für die Kosten des Händlernetzes. Der Prüfer las es anders: als Proxy für Ethnie in mehreren Metropolmärkten. Die SHAP-Dokumentation der Bank zeigte den Beitrag des Features, enthielt aber keine Analyse seines Disparate Impact. Ergebnis war ein Memorandum of Understanding mit Auflagen zur Modellsanierung und einem Second-Look-Programm für betroffene Antragsteller. Die Kosten lagen jenseits von 40 Millionen Dollar, inklusive Remediation, Monitoring-Infrastruktur und Anwaltshonoraren.

Wann funktionieren Post-hoc-Tools wie SHAP und wann nicht?

Post-hoc-Explainability-Tools funktionieren gut, wenn das Modell relativ stabil ist, das Feature-Set von Fachexperten interpretierbar ist und die Prognoseaufgabe eine klare Ground Truth hat, die sich über die Zeit validieren lässt. Klassisches Credit Scoring, die Optimierung von Betrugsregeln und Modelle zur Sicherheitenbewertung liegen in dieser Zone.

Schlecht funktionieren sie bei Foundation Models und LLMs, die in Kredit- oder Compliance-Workflows eingesetzt werden. Wenn eine Bank ein LLM einsetzt, um die Jahresabschlüsse eines Firmenkunden zusammenzufassen und ein Risikonarrativ zu erzeugen, ist das Erklärungsproblem qualitativ anders. Es gibt keinen Feature-Importance-Vektor. Das „Reasoning“ ist eine Funktion von Attention-Mustern über Milliarden Parameter. SHAP zu bitten, den Output eines LLM zu erklären, ist ungefähr so, als bäte man einen Flugschreiber, die Absicht des Piloten zu erklären.

Kreditmodelle zu bauen, die einer Fair-Lending-Prüfung standhalten, heißt zunehmend, Modellarchitekturen von Anfang an mit Blick auf Governance zu wählen, statt Explainability nach dem Deployment nachzurüsten. Constrained Models, monotones Gradient Boosting oder Scorecard-Ensembles mit expliziten Feature-Obergrenzen sind auf Holdout-Sets weniger treffsicher als unbeschränkte Deep-Modelle. Sie sind aber weit besser vertretbar, wenn ein OCC-Prüfer sich Ihre MRM-Dokumentation vornimmt.

Der ehrliche Tradeoff: Eine Bank, die rein auf Predictive Lift optimiert, bringt Modelle in den Einsatz, die auf dem Papier besser abschneiden und Prüfungen schlechter überstehen. Zwischen 8 % Gini-Verbesserung und einer Consent Order ist die Rechnung nicht knapp.

SR 11-7 wird irgendwann durch spezifischere AI-Guidance abgelöst, und OCC und Fed haben signalisiert, dass Updates in Arbeit sind. Bis dahin bleibt der Text von 2011 der operative Standard, und die Banken, die Explainability als Dokumentationsübung statt als Design-Constraint behandeln, bauen sich eine Haftung auf, ein Modell-Deployment nach dem anderen.

Der vollständige Kurs zu diesem Sektor:AI in Banking.

Häufige Fragen

Gilt SR 11-7 auch für LLMs und Machine-Learning-Modelle?

Ja. SR 11-7 stammt von 2011 und wurde nie ersetzt, also wenden Federal Reserve und OCC den Text auf Gradient Boosting, Foundation Models und LLM-gestützte Tools an. Ein LLM, das Verdachtsmeldungen erzeugt, seine Argumentationskette aber nicht darlegt, gilt nach dieser Logik als unerklärtes Modell, auf dessen Output sich die Bank stützt.

Reichen SHAP-Werte für Adverse Action Notices nach ECOA aus?

Nur mit zusätzlicher Dokumentation. SHAP weist jedem Feature pro Vorhersage einen Beitrag zu und liefert damit eine Grundlage für Reason Codes, approximiert das Modellverhalten aber, statt es exakt zu beschreiben. Fragt ein CFPB-Prüfer nach der Korrektheit, braucht die Bank validierte Toleranzgrenzen für diese Näherung.

Haftet eine Bank für Scoring-Modelle von externen Anbietern?

Ja, unter SR 11-7 trägt die Bank das Modellrisiko unabhängig davon, wer das Modell gebaut hat. JPMorgan Chase, Wells Fargo und Bank of America nutzen Anbietermodelle für Teile ihrer Kreditentscheidungen. Liefert der Anbieter kein Model Fact Sheet, das einem Prüfer genügt, steht die Bank dafür gerade.

Was kostet eine gescheiterte Fair-Lending-Prüfung bei einem Kreditmodell?

Eine mittelgroße US-Regionalbank im Südosten zahlte 2024 über 40 Millionen Dollar, nachdem ihr LightGBM-Pricing-Modell für Autokredite die Postleitzahl als Top-5-Feature nutzte. Der Prüfer las das Feature als Proxy für Ethnie; es folgten ein Memorandum of Understanding, Modellsanierung, ein Second-Look-Programm und Anwaltshonorare.

Mehr dazu

Die Lektionen, die diesen Artikel weiterführen, frei zugänglich.

  1. 1Model Risk erkennen, bevor daraus ein Loss Event wirdKI im Banking
  2. 2Kreditentscheidungsmodelle bauen, die einer Fair-Lending-Prüfung standhaltenKI im Banking
  3. 3Wie die Regulierungslandkarte für KI im Banking tatsächlich zusammenpasstKI im Banking
  4. 4Den Pre-Deployment-Gauntlet durchlaufen: Prüfungen, die Probleme früh aufdeckenKI im Banking
  5. 5Eine Compliance-Funktion aufbauen, die ein Audit überstehtBanking: Wie der Sektor funktioniert

Artikel gelesen?

Bestätigen Sie Ihre Lektüre, um XP zu sammeln und Ihr Radar zu füttern.