+150 XP

Kontinuierliches Monitoring und Incident Response

Der Scan, der gedriftet ist

2021 dokumentierten Forscher ein Phänomen, das Radiologie-KI-Teams wach hält: Ein Modell für Thorax-Röntgenbilder, trainiert in einem Krankenhaus, verlor an Genauigkeit, nachdem das Krankenhaus den Scanner-Hersteller gewechselt hatte. Für einen Menschen sahen die Pixel gleich aus. Für das Modell hatte sich die Welt verschoben. Nichts fiel laut aus. Die Sensitivität erodierte einfach still, Scan für Scan.

Das ist das Kernproblem von KI in der Medizintechnik. Ein Medikament ändert nach der Zulassung seine Chemie nicht. Ein KI-Modell degradiert in dem Moment, in dem die Realität von seinen Trainingsdaten wegdriftet. Deshalb behandeln Regulierer ausgerollte KI als lebendes System, das kontinuierlich beobachtet werden muss, und nicht als Produkt, das man ausliefert und vergisst.

Diese Lektion baut den Post-Market-Surveillance-Loop auf: Drift-Erkennung, Audit Trails, Rollback und die regulatorischen Meldungen, die Sie einreichen, wenn etwas schiefgeht.

Warum Modelle nach dem Deployment driften

„Drift“ heißt, dass die statistische Beziehung, die das Modell gelernt hat, nicht mehr gilt. Zwei Varianten sind relevant:

  • Data Drift: Die Inputs ändern sich. Neuer Scanner, neue Patientenpopulation, ein Software-Update, das den Bildkontrast verändert.
  • Concept Drift: Die Beziehung zwischen Inputs und der richtigen Antwort ändert sich. Eine neue Krankheitsvariante, eine überarbeitete diagnostische Leitlinie.

Konkretes Beispiel: Ein Sepsis-Vorhersagemodell, das in US-Krankenhäusern eingesetzt wurde, schnitt laut einer externen Validierung von 2021 (veröffentlicht in JAMA Internal Medicine) deutlich schlechter ab als im Marketing behauptet, unter anderem weil sich die lokalen Populationen vom Entwicklungsdatensatz unterschieden. Der Deployment-Kontext ist kein Detail. Er ist das ganze Spiel.

Der regulatorische Rahmen, in dem Sie sich bewegen

Sie können kein Monitoring designen, ohne zu wissen, was Sie melden müssen. Nennen wir die realen Instanzen:

  • Die US FDA reguliert KI-basierte Medizinprodukte als SaMD (Software as a Medical Device). Die FDA führt eine öffentliche Liste KI-basierter Medizinprodukte, die die Marke von 1.000 zugelassenen Produkten überschritten hat (FDA-Zahl, Stand Ende 2024). Die Post-Market-Pflichten laufen über MDR (Medical Device Reporting): Schwerwiegende unerwünschte Ereignisse und Produktfehlfunktionen sind grundsätzlich innerhalb von 30 Tagen zu melden.
  • Das Predetermined Change Control Plan (PCCP)-Framework der FDA (Guidance 2024 finalisiert) erlaubt es Ihnen, bestimmte Modell-Updates vorab autorisieren zu lassen, sodass Sie ohne neue Einreichung nachtrainieren können, sofern Sie das Update-Protokoll vorab definiert haben.
  • Europa: KI-Medizinprodukte fallen unter die MDR (Medical Device Regulation 2017/745) plus den EU AI Act (in Kraft seit 2024, Hochrisiko-Pflichten greifen gestuft bis 2026 und 2027). Die meiste diagnostische KI gilt als hochriskant, was verpflichtendes Post-Market-Monitoring, Logging und Anforderungen an die menschliche Aufsicht auslöst. Notified Bodies (private Konformitätsbewertungsstellen, zum Beispiel TÜV SÜD) auditieren Ihr Qualitätssystem.

Die praktische Erkenntnis: Kontinuierliches Monitoring ist keine Best Practice. Es ist in beiden Märkten eine rechtliche Pflicht.

Den Surveillance-Loop aufbauen

Denken Sie in vier verbundenen Stufen: detect, investigate, act, report.

1. Detect: Drift-Alerts

Sie überwachen zwei Dinge: die Inputs und die Outputs.

Input-Monitoring vergleicht die Verteilungen der Live-Daten mit Ihrer Trainings-Baseline. Ein verbreitetes statistisches Werkzeug ist der Population Stability Index (PSI), der misst, wie stark sich eine Verteilung verschoben hat.

python
import numpy as np

def psi(expected, actual, bins=10):
    # expected = Trainingsverteilung, actual = Live-Daten
    e_pct, edges = np.histogram(expected, bins=bins)
    a_pct, _     = np.histogram(actual, bins=edges)
    e_pct = e_pct / e_pct.sum() + 1e-6
    a_pct = a_pct / a_pct.sum() + 1e-6
    return np.sum((a_pct - e_pct) * np.log(a_pct / e_pct))

# Daumenregel-Schwellen (Branchenkonvention, keine Regulierung):
# PSI < 0.1  = stabil
# 0.1 - 0.25 = moderate Verschiebung, untersuchen
# > 0.25     = signifikante Drift, eskalieren
score = psi(training_pixel_intensity, live_pixel_intensity)

Bei einem Radiologie-Modell könnten Sie die mittlere Pixelintensität, Metadaten zur Bildauflösung und den Mix der Scanner-Hersteller verfolgen. Wenn ein neuer Scanner den PSI über 0,25 treibt, bekommen Sie einen Alert, bevor die Genauigkeit sichtbar sinkt.

Output-Monitoring beobachtet das Verhalten des Modells selbst: Verteilung der Prediction-Confidence, Positivrate und, wo Sie Ground Truth haben, die tatsächliche Performance. Wenn Ihr Modell normalerweise 8 % der Thorax-Scans als auffällig markiert und plötzlich 20 %, ist das ein Signal, noch bevor die Pathologie irgendetwas bestätigt.

Der schwierige Teil in der Medizin: Ground Truth kommt verzögert. Oft wissen Sie erst Wochen später durch eine Biopsie, einen Kontrollscan oder eine verpasste Diagnose, dass das Modell falsch lag. Deshalb stützen Sie sich auf Proxy-Signale (Confidence, Input-Drift, Override-Raten der Radiologen) als Frühwarnung.

2. Investigate: der Audit Trail

Wenn ein Alert ausgelöst wird, müssen Sie exakt rekonstruieren können, was passiert ist. Ihr Audit Trail sollte für jede Prediction erfassen:

  • Modellversion und Identifier
  • Input-Hash und wichtige Metadaten (Gerät, Zeitstempel, Standort)
  • Den Output und den Confidence Score
  • Ob ein Mensch zugestimmt oder überstimmt hat

Der EU AI Act verlangt für Hochrisikosysteme ausdrücklich automatisches Logging, aufbewahrt über die gesamte Produktlebensdauer. Das ist keine optionale Bürokratie. Wenn eine Ärztin fragt „warum hat die KI diesen Tumor übersehen“, müssen Sie mit der exakten Modellversion und den Inputs antworten können. Wenn Sie eine Entscheidung nicht reproduzieren können, können Sie sie nicht verteidigen und nicht korrigieren.

Die Override-Rate der Radiologen ist eines der reichhaltigsten Signale. Wenn Overrides in einer Klinik von 5 % auf 15 % springen, sieht diese Klinik etwas, mit dem Ihr Modell schlecht umgeht. Loggen Sie es, segmentieren Sie nach Standort und beobachten Sie es.

3. Act: Rollback-Protokolle

Wenn Sie ein Problem bestätigt haben, brauchen Sie eine schnelle, geübte Reaktion. Borgen Sie sich das vom Software Engineering:

  • Versionieren Sie alles. Jedes ausgerollte Modell hat ein unveränderliches Version Tag. Sie überschreiben nie; Sie deployen parallel.
  • Rollback = Traffic auf die vorherige bekannt-gute Version umleiten. Das sollte Minuten dauern, nicht einen Einreichungszyklus.
  • Canary Deployment: Ein neues Modell auf einem kleinen Teil des Traffics ausrollen (etwa ein Krankenhaus oder 5 % der Scans) und sein Verhalten mit dem bisherigen Modell vergleichen, bevor Sie vollständig ausrollen.
  • Human-in-the-loop-Fallback: Wenn die Confidence einbricht, leiten Sie diese Fälle an eine Radiologin weiter, statt automatisch zu befunden. Eine degradierte KI, die abgibt, ist sicherer als eine, die rät.

Definieren Sie Ihren Decommission-Trigger im Vorfeld: Bei welchem gemessenen Performance-Abfall nehmen Sie das Modell komplett vom Netz? Schreiben Sie das vor der Krise auf, nicht während ihr.

Wissenscheck

1. Warum argumentiert die Lektion, dass KI-Modelle kontinuierliche Post-Market Surveillance brauchen, ein zugelassenes Medikament aber nicht?

2. Ein Krankenhaus wechselt den Scanner-Hersteller, und die Sensitivität eines Thorax-Röntgen-Modells erodiert langsam, obwohl die Bilder für Menschen identisch aussehen. Welches Phänomen beschreibt das am besten?

3. Ein Modell wird auf denselben Patienten nachtrainiert, aber eine neu aufgetretene Krankheitsvariante verändert, welche Symptome tatsächlich auf eine Infektion hindeuten. Welche Art von Drift ist das, und warum ist das relevant?

MEHRFACHAUSWAHL

4. Wählen Sie ALLE richtigen Antworten dazu, warum das Sepsis-Vorhersagemodell in der externen Validierung schlechter abschnitt als angekündigt.

Wählen Sie alle richtigen Antworten aus.

MEHRFACHAUSWAHL

5. Wählen Sie ALLE richtigen Antworten, die Bestandteile eines belastbaren Post-Market-Surveillance-Loops für ausgerollte medizinische KI beschreiben.

Wählen Sie alle richtigen Antworten aus.

4. Report: regulatorische Meldung

Wenn ein KI-Versagen Patienten schädigt oder schädigen könnte, ist die Meldung verpflichtend und fristgebunden.

  • USA (FDA MDR): Hersteller melden Todesfälle und schwere Verletzungen sowie Fehlfunktionen, die bei Wiederholung wahrscheinlich Schaden verursachen, grundsätzlich innerhalb von 30 Kalendertagen. Für Ereignisse, die dringende Korrekturmaßnahmen erfordern, gilt ein Fenster von 5 Tagen. (FDA-Fristen, Stand 2025.)
  • EU (MDR): Schwerwiegende Vorkommnisse müssen der zuständigen Behörde grundsätzlich innerhalb von 15 Tagen gemeldet werden; Tod oder unvorhergesehene schwerwiegende Verschlechterung löst ein Fenster von 10 Tagen aus; eine unmittelbare schwerwiegende Gefahr für die öffentliche Gesundheit erfordert eine Meldung innerhalb von 2 Tagen. (Fristen nach MDR Artikel 87.)

Ein driftendes Modell, das zu einer verpassten Diagnose geführt hat, ist meldepflichtig. Beachten Sie die Asymmetrie: Die EU-Fristen für Vorkommnisse können enger sein als die der FDA, ein globales Deployment orientiert sich deshalb standardmäßig an der strengsten Uhr.

Ein durchgerechnetes Beispiel

Ihr Modell zur Lungenknoten-Erkennung läuft in 12 Krankenhäusern. Das Monitoring zeigt:

  • Krankenhaus 7 hat einen neuen CT-Scanner installiert. Der Input-PSI auf der Pixelintensität steigt auf 0,31 (über der Schwelle von 0,25).
  • Die Override-Rate der Radiologen in Krankenhaus 7 steigt in zwei Wochen von 6 % auf 14 %.
  • Ein bestätigter übersehener Knoten, später in der Nachkontrolle entdeckt.

Reaktionsablauf:

1. Alert wird durch die PSI-Überschreitung ausgelöst. Untersuchung über den Audit Trail, Eingrenzung auf Krankenhaus 7 und den neuen Scanner.

2. Act: Scans aus Krankenhaus 7 in die primär menschliche Befundung leiten (KI nur als Zweitleser). Ein Rollback ist anderswo nicht nötig; die Drift ist lokal begrenzt.

3. Report: Der übersehene Knoten ist ein schwerwiegendes Vorkommnis. Nach EU MDR innerhalb von 15 Tagen melden, nach FDA MDR innerhalb von 30.

4. Remediate: Wenn Ihr PCCP das Nachtrainieren auf Scanner-Hersteller abdeckt, trainieren und validieren Sie unter dem vorab autorisierten Protokoll auf den Daten des neuen Scanners.

Lokal begrenzte Drift, schnell eingedämmt, ehrlich gemeldet. So funktioniert der Loop.

Häufige Failure Modes

  • Nur Accuracy monitoren. Wenn die Accuracy mit bestätigter Ground Truth sinkt, waren Patienten schon betroffen. Beobachten Sie Inputs und Proxys.
  • Keine Versionierung. Sie können nichts zurückrollen, was Sie nicht benennen können.
  • Stille Auto-Updates. Eine nicht geloggte Modelländerung ist ein Compliance- und Sicherheitsloch.
  • Subgruppen ignorieren. Ein Modell kann insgesamt stabil sein und gleichzeitig für ein Krankenhaus, eine demografische Gruppe oder ein Gerät stark degradieren.

Key Takeaways

  • KI-Produkte degradieren; überwachen Sie sie als lebende Systeme. Drift (Data oder Concept) ist der Normalfall, nicht die Ausnahme. Sowohl FDA als auch EU AI Act schreiben Post-Market Surveillance vor.
  • Beobachten Sie Inputs und Proxys, nicht nur Accuracy. Nutzen Sie PSI auf Input-Verteilungen, Prediction-Raten und Override-Raten der Radiologen als Frühwarnung, weil Ground Truth in der Medizin spät eintrifft.
  • Loggen Sie alles, unveränderlich. Modellversion, Inputs, Outputs, menschliche Overrides. Der EU AI Act verlangt Logging über die Lebensdauer, und Sie können nicht reparieren oder verteidigen, was Sie nicht rekonstruieren können.
  • Üben Sie den Rollback vor dem Vorfall. Version Tags, Canary Releases, Human-in-the-loop-Fallback und ein vorab formulierter Decommission-Trigger machen aus einer Krise eine Prozedur.
  • Kennen Sie Ihre Melde-Uhren. EU MDR: schwerwiegende Vorkommnisse grundsätzlich innerhalb von 15 Tagen (2 Tage bei Gefahr für die öffentliche Gesundheit); FDA MDR grundsätzlich 30 Tage (5 bei Dringlichkeit). Globale Deployments richten sich standardmäßig nach der strengsten Frist.