+150 XP

Model Risk Management für Investment-KI

# Model Risk Management für Investment-KI

2007 lösten sich mehrere quantitative Aktienfonds innerhalb weniger Tage auf. Ihre Modelle, trainiert auf ähnlichen Daten mit ähnlichen Annahmen, verkauften alle dieselben Titel zur selben Zeit. Niemand hatte das Risiko modelliert, dass die Modelle selbst die Masse waren. Fast zwei Jahrzehnte später hat Machine Learning diesen Fehlermodus schneller, opaker und schwerer erkennbar gemacht. Diese Lektion zeigt Ihnen, wie Sie ihn steuern.

Warum SR 11-7 immer noch den Maßstab setzt

SR 11-7 ist eine 2011 von der US-Notenbank Federal Reserve und dem Office of the Comptroller of the Currency (OCC) veröffentlichte Leitlinie. Sie definiert ein „Modell“ als jede quantitative Methode, die Eingabedaten in eine Schätzung verwandelt, und verlangt, dass jedes Modell unabhängig validiert, vollständig dokumentiert und laufend überwacht wird. Geschrieben wurde sie für Banken, aber sie ist zum De-facto-Weltstandard für Model-Risk-Disziplin geworden.

Lesen Sie die Primärquelle einmal. Sie ist kurz und gut lesbar: Federal Reserve SR 11-7 guidance.

Der Kerngedanke: Modellrisiko ist das Verlustrisiko aus einem Modell, das falsch ist oder falsch eingesetzt wird. SR 11-7 unterteilt es in zwei Quellen.

  • Das Modell ist grundlegend fehlerhaft. Schlechte Annahmen, schlechte Daten, schlechte Mathematik.
  • Das Modell wird falsch eingesetzt. Richtiges Werkzeug, falscher Kontext, oder niemand prüft es nach dem Deployment.

ML-Alpha-Modelle scheitern in beiden Punkten häufiger als lineare Modelle, weil sie flexibler und weniger interpretierbar sind. Flexibilität ist genau das, was sie Rauschen auswendig lernen lässt.

Die Disziplin auf ML-Alpha und Allokation übertragen

SR 11-7 ruht auf drei Säulen. So lässt sich jede auf einen KI-getriebenen Investmentprozess abbilden.

1. Robuste Entwicklung und Dokumentation

Jedes ML-Signal braucht eine schriftliche „Model Card“: was es prognostiziert, auf welchen Daten, über welches Universum, mit welchen bekannten Grenzen. Wenn ein Portfoliomanager nicht in einem Absatz erklären kann, was ein Signal tut, sollte es keine Position dimensionieren.

Für Asset Management speziell: dokumentieren Sie die Look-ahead-Disziplin. Ein Look-ahead-Fehler bedeutet, dass das Modell Informationen gesehen hat, die es in Echtzeit nicht gehabt hätte. Beispiel: die neu ausgewiesenen Gewinne eines Unternehmens (Monate später veröffentlicht) zu verwenden, als wären sie am Datum des ursprünglichen Berichts verfügbar gewesen. Dieser einzelne Fehler ist die häufigste Ursache für Backtests, die brillant aussehen und mies traden.

2. Unabhängige Validierung

Das Team, das das Modell baut, kann nicht das Team sein, das es abzeichnet. In der Praxis betreibt ein mittelgroßer Asset Manager eine Validierungsfunktion, die das Signal von Null an neu implementiert, auf zurückgehaltenen Daten, und versucht, es zu brechen. Das ist keine Formalie. Unabhängige Validierung findet das subtile Leakage, für das die Entwickler blind sind, weil sie wollen, dass das Modell funktioniert.

3. Laufende Überwachung

Märkte sind nicht stationär. Ein Signal, das im Niedrigzinsregime von 2015 bis 2021 funktioniert hat, kann in einem Regime höherer Zinsen und höherer Inflation aktiv schädlich sein. Monitoring heißt, die Live-Performance gegen die Backtest-Erwartungen zu verfolgen und eine Überprüfung auszulösen, wenn sie auseinanderlaufen.

Die drei KI-spezifischen Risiken, die Investmentmodelle kaputt machen

Backtest-Overfitting

Testen Sie genügend Strategien gegen die Historie, und einige werden aus reinem Zufall profitabel aussehen. Das ist Backtest-Overfitting: Glück mit Können verwechseln.

Die Mathematik ist unerbittlich. Marcos Lopez de Prado hat gezeigt: Wenn Sie viele Strategiekonfigurationen probieren und die beste Sharpe Ratio behalten, ist dieses beste Ergebnis nach oben verzerrt, manchmal massiv. Die Deflated Sharpe Ratio korrigiert eine berichtete Sharpe um die Anzahl der durchgeführten Versuche und die Länge des Track Records.

Ein einfacher, konkreter Guardrail: protokollieren Sie jeden Backtest, den Sie laufen lassen.

python
# Track the number of independent trials so you can deflate later
import json, datetime

def log_trial(strategy_id, config, sharpe):
    record = {
        "ts": datetime.datetime.utcnow().isoformat(),
        "strategy_id": strategy_id,
        "config": config,
        "in_sample_sharpe": sharpe,
    }
    with open("trials.log", "a") as f:
        f.write(json.dumps(record) + "\n")
    # Eine berichtete Sharpe von 2,0 aus 1 Versuch ist etwas völlig anderes
    # als eine Sharpe von 2,0, die als beste aus 500 Versuchen ausgewählt wurde.

Rechenbeispiel (illustrativ, keine echte Strategie): Angenommen, Sie testen 100 Signalvarianten, und die beste zeigt über 5 Jahre eine jährliche Sharpe von 1,5. Weil Sie das Maximum aus 100 verrauschten Schätzungen ausgewählt haben, ist ein erheblicher Teil dieser 1,5 Selektionsglück. Die Deflation könnte die „echte“ erwartete Sharpe auf 0,5 oder darunter drücken. Die Daumenregel: je mehr Konfigurationen Sie probiert haben, desto höher die Hürde, die der Gewinner überspringen muss.

Regimewechsel

Ein ML-Modell lernt die gemeinsame Verteilung seiner Trainingsdaten. Wenn sich diese Verteilung ändert (ein Regimewechsel), weiß das Modell nicht, dass es jetzt extrapoliert.

Guardrails:

  • Regime-bewusste Validierung. Teilen Sie die Daten nicht einfach zufällig auf. Testen Sie explizit über definierte Regime: 2008, den COVID-Schock 2020, die Zins-Neubewertung 2022. Ein Signal, das nur in ruhigen Märkten funktioniert, ist eine versteckte Short-Volatility-Wette.
  • Feature-Drift-Monitoring. Verfolgen Sie, ob die Live-Input-Verteilungen den Trainingsverteilungen entsprechen. Wenn die Inputs Ihres Value-Signals driften, soll der Alarm vor dem P&L kommen.

Black-Box-Signale, die über echtes Kapital entscheiden

Wenn ein Gradient-Boosted-Modell oder ein Neural Net einen Trade erzeugt, ist „das Modell hat es gesagt“ keine akzeptable Antwort für ein Risikokomitee.

Nutzen Sie Explainability-Tools, am häufigsten SHAP (SHapley Additive exPlanations), das eine Prognose ihren Input-Features zuordnet. Wenn das Top-Signal eines Titelselektionsmodells plötzlich ein obskures Feature ist, ist das ein Warnzeichen. Explainability macht eine Black Box nicht sicher. Sie macht sie auditierbar, und das ist, was Governance verlangt.

The Deflated Sharpe Ratio and Backtest Overfitting

Watch on YouTube

Die Regulierungslandkarte für 2026

Modellrisiko in Investment-KI liegt heute im Schnittpunkt mehrerer realer Regime.

  • EU AI Act. Seit 2024 in Kraft, mit gestufter Anwendung bis 2026 und 2027. Er klassifiziert KI-Systeme nach Risiko. Die meisten Portfoliomodelle sind nach dem Act nicht „hochriskant“, aber die Erwartungen an Governance, Logging und menschliche Aufsicht setzen den Ton, den europäische Aufseher anlegen werden. Siehe den offiziellen Text des EU AI Act.
  • SEC (USA). Der 2023 vorgeschlagene Rule-Entwurf der Securities and Exchange Commission zu predictive data analytics und Interessenkonflikten signalisierte eine intensive Prüfung von KI, die das Interesse eines Hauses über das eines Kunden stellen könnte. Anfang 2026 ist die endgültige Form noch umstritten, behandeln Sie das also als bewegliches Ziel und prüfen Sie den aktuellen Stand.
  • DORA (EU). Der Digital Operational Resilience Act, anwendbar ab Januar 2025, regelt IKT- und Drittparteienrisiken. Wenn Ihr Alpha-Modell auf der Cloud eines Anbieters läuft oder einen Datenfeed eines Anbieters nutzt, greift DORA.
  • UK. Die Financial Conduct Authority (FCA) bevorzugt einen prinzipienbasierten, ergebnisorientierten Ansatz statt präskriptiver KI-Regeln und stützt sich auf die bestehenden Accountability-Regime für Senior Manager.

Der gemeinsame Faden durch alle: Verantwortung muss an einen namentlich benannten Menschen gebunden sein, und Entscheidungen müssen dokumentiert und reproduzierbar sein.

Wissenscheck

1. Das Quant-Fonds-Unwind von 2007 dient als Illustration für welches Modellrisiko, das für ML-getriebenes Investieren besonders relevant ist?

2. Was gilt nach der Definition von SR 11-7 als „Modell“, das Governance erfordert?

3. Warum argumentiert die Lektion, dass ML-Alpha-Modelle bei beiden Risikoquellen von SR 11-7 häufiger scheitern als lineare Modelle?

MEHRFACHAUSWAHL

4. Wählen Sie ALLE richtigen Antworten zu den beiden von SR 11-7 identifizierten Quellen des Modellrisikos.

Wählen Sie alle richtigen Antworten aus.

MEHRFACHAUSWAHL

5. Wählen Sie ALLE richtigen Antworten dazu, was die SR 11-7-Säule „robuste Entwicklung und Dokumentation“ verlangt, angewendet auf ein ML-Alpha-Signal.

Wählen Sie alle richtigen Antworten aus.

Eine Pre-Deployment-Checkliste, die Sie wirklich durchlaufen können

Bevor ein ML-Signal echtes Kapital berührt, gehen Sie durch dieses Gate. Fällt ein Punkt durch, kein Deployment.

Datenintegrität

  • Kein Look-ahead. Point-in-time-Daten bestätigt.
  • Survivorship Bias geprüft (delistete Titel im Universum vorhanden).
  • Trainings- und Live-Datenpipelines sind identischer Code.

Overfitting-Kontrolle

  • Anzahl der Versuche protokolliert; Deflated Sharpe angewendet.
  • Out-of-sample- und Out-of-time-Test auf Daten bestanden, die das Modell nie gesehen hat.
  • Performance übersteht realistische Transaktionskosten und Slippage.

Robustheit

  • Über mindestens drei historische Stressregime getestet.
  • Feature-Drift-Monitore mit Alarmschwellen konfiguriert.
  • Kapazität geschätzt: wie viel Kapital, bevor das Signal den Markt gegen sich selbst bewegt.

Governance

  • Abzeichnung der unabhängigen Validierung in der Akte.
  • Model Card geschrieben; namentlicher Owner zugewiesen.
  • Kill Switch definiert: welche Bedingungen das Modell offline zwingen und wer die Befugnis hat, den Stecker zu ziehen.

Der letzte Punkt zählt am meisten. Das Quant-Unwind von 2007 wurde nicht von einem schlechten Modell verursacht. Es wurde davon verursacht, dass niemand die Befugnis oder den Auslöser hatte, rechtzeitig aus der Masse herauszutreten.

Key Takeaways

  • Die drei Säulen von SR 11-7 (Entwicklung, unabhängige Validierung, laufende Überwachung) lassen sich direkt auf ML-Investmentmodelle abbilden. Der Entwickler zeichnet nie seine eigenen Hausaufgaben ab.
  • Backtest-Overfitting ist ein messbares, nicht vages Risiko. Protokollieren Sie Ihre Versuche und deflationieren Sie Ihre Sharpe. Ein großartiger Backtest aus 500 Versuchen ist meist Rauschen.
  • Validieren Sie über Regime, nicht über zufällige Splits. Ein Modell, das nur von 2015 bis 2021 funktioniert hat, ist eine versteckte Wette darauf, dass dieses Regime anhält.
  • Explainability macht Black Boxes auditierbar, nicht sicher. Nutzen Sie SHAP, um zu erkennen, wenn ein Modell sich auf Features stützt, auf die es sich nicht stützen sollte.
  • Jedes deployte Modell braucht einen namentlichen Owner und einen Kill Switch. Accountability und eine definierte Ausfahrt sind das, was Regulierer (EU AI Act, SEC, FCA) zunehmend verlangen.