KIKI im FintechFintech

Fintech-KI nach der Evidenzuhr terminieren

Anbieter von Fintech-KI versprechen inzwischen ein Go-live in wenigen Tagen, doch der Bau des Agenten war nie der Grund für verspätete Projekte. In der regulierten Finanzbranche ist der realistische Zeitplan die Zeit, die Sie brauchen, um genug beobachtete Ergebnisse auf Ihrer Worst-Case-Metrik zu sammeln. Dieser Beitrag zeigt, wie Sie diese Zeit berechnen.

Giant hourglass trickling coins in a bank hall, few red coins below, robot agent and officer waiting beside it.

Fragen Sie im Oktober 2026 einen Anbieter von Fintech-KI, wie lange das Deployment dauert, und Sie bekommen eine Antwort in Tagen oder Wochen. Fragen Sie Ihren MLRO oder Ihre Leitung Model Risk, bekommen Sie eine andere Antwort, meist ohne Zahl. Die Lücke hat einen Namen: die Evidenzuhr. Gemeint ist die Zeit, die ein produktives KI-System braucht, um genug beobachtete Ergebnisse auf der Metrik zu liefern, die Ihre Kontrollfunktionen interessiert, damit es handeln darf, ohne dass ein Mensch jeden Fall prüft.

Meine These: In der regulierten Finanzbranche bestimmt die Evidenzuhr den realistischen Zeitplan, und wie selten Ihr schlimmstes Ergebnis ist, bestimmt die Evidenzuhr. Modellqualität und Build-Geschwindigkeit zählen viel weniger. Die Wahl der Erfolgsmetrik und die Wahl des Launch-Termins sind deshalb eine einzige Entscheidung. Steht die Guardrail-Metrik fest, ergibt sich das Datum aus der Arithmetik.

Warum Hermes for Businesses Fintech-KI-Zeitpläne nicht verkürzt

Die Build-Uhr wird immer kürzer. Gestern, am 7. Oktober, bestätigte Nous Research den Abschluss einer Series B über 90 Millionen US-Dollar bei einer Bewertung von 1,5 Milliarden US-Dollar. Zusammen mit der Ankündigung startete das Unternehmen Hermes for Businesses, einen Vorstoß, seinen Open-Source-Agenten Hermes direkt an Unternehmen zu verkaufen. Das Paket umfasst private Deployment, Single Sign-On, Auditing, Workspace-Kontrollen, gemeinsame Team-Skills, Kostentransparenz und Service-Level-Agreements. Genau diese Funktionen fragt ein Fintech-CISO zuerst ab. Der kommerzielle Schwung ist groß: Laut The Wall Street Journal lag Nous Mitte September 2026 bei rund 36 Millionen US-Dollar annualisiertem Umsatz und erwartet, vor Ende 2026 die Marke von 100 Millionen US-Dollar zu überschreiten. Die Angaben zur Verbreitung sollten Sie vorsichtig lesen. Die Zahl, wonach Hermes rund 2,5 % der weltweiten KI-Token-Nutzung ausmacht, stammt von Nous selbst und wurde nicht unabhängig überprüft.

Solche Bewertungen setzen alle in der Kette unter Druck. Dealroom merkte bei der ersten Meldung der Runde an, dass Unternehmen, die zu solchen Zahlen Kapital aufnehmen, schnell messbaren Nutzen nachweisen müssen, und dass autonome Agenten sich in vielen realen Workflows noch nicht bewährt haben. Bei Ihnen kommt dieser Druck als Sales-Pitch an: Der Agent ist fertig, warum ist er nicht live?

Fintech ist anders, weil es dem Kontrollumfeld egal ist, wie schnell der Agent konfiguriert wurde. Drei Fakten aus 2026 machen das konkret.

  • In den USA gibt es keine Vorlage mehr. Am 17. April 2026 veröffentlichten das Office of the Comptroller of the Currency, das Federal Reserve Board und die Federal Deposit Insurance Corporation gemeinsam eine überarbeitete interagency guidance, die das Framework von 2011 vollständig aufhebt, und in der Nachfolgeregelung (SR 26-2 / OCC Bulletin 2026-13) sind generative KI und agentische KI-Modelle ausdrücklich vom Anwendungsbereich ausgenommen. Wenn Sie einen LLM-Agenten bei einer Bank oder einem Fintech mit Bankpartner einsetzen, gibt Ihnen niemand einen vorgeschriebenen Validierungspfad. Sie müssen Ihren eigenen Evidenzstandard schreiben und dann zeigen, dass Sie ihn erfüllt haben.
  • In der EU hat sich die Uhr verschoben, läuft aber weiter. Der Digital Omnibus hat die Hochrisiko-Pflichten nach Anhang III, die das Kredit-Scoring umfassen, von August 2026 auf den 2. Dezember 2027 verschoben, während die Transparenzpflichten nach Artikel 50 unverändert blieben und seit dem 2. August 2026 gelten. Verstöße im Hochrisikobereich kosten bis zu 15 Millionen € oder 3 % des weltweiten Umsatzes.
  • Die Konkurrenz ist schneller. Die globale Umfrage 2026 des Cambridge Centre for Alternative Finance ergab, dass Fintechs bei der Einführung fortgeschrittener KI mit 47 % zu 30 % vor etablierten Instituten liegen und dass Fintechs auch hier besser abschneiden: 56 % melden höhere Profitabilität, gegenüber 34 % der traditionellen Finanzinstitute. Laut demselben Bericht sehen derzeit nur 14 % KI als transformativ für ihre Unternehmensstrategie und ihren Wettbewerbsvorteil.

Sie haben es also mit einem Vorstand zu tun, der Wettbewerber liefern sieht und Anbieter Tage versprechen hört, und mit Prüfern, die fragen werden, welche Evidenz jede autonome Entscheidung gerechtfertigt hat. Mit der Evidenzuhr geben Sie beiden ein Datum, das Sie verteidigen können.

Wie funktioniert die Evidenzuhr bei einem Fintech-KI-Rollout?

Die Evidenzuhr ist die Zahl realer Fälle Ihres schlimmsten Ergebnisses, die Sie beobachten müssen, geteilt durch die Zahl solcher Fälle, die Ihr Volumen pro Monat erzeugt, plus der Prüfzyklus derjenigen, die abzeichnen. Die einzelnen Bestandteile werden unten beschrieben.

Jede Value-Metrik braucht eine Guardrail, die jemand anderem gehört

Eine Erfolgsmetrik für Fintech-KI hat zwei Hälften. Die Value-Hälfte ist das, was der Business Case verspricht: Bearbeitungszeit, abgearbeitete Alerts pro Analyst, Kosten pro gelöstem Dispute. Die Guardrail-Hälfte ist der Schaden, der den Regulator interessieren würde: übersehene verdächtige Aktivitäten, falsche Ablehnungsgründe, stattgegebene Beschwerden, Kunden, die keinen Menschen erreichen konnten. Die Guardrail braucht einen Owner außerhalb des Projektteams (Compliance in der zweiten Verteidigungslinie, MLRO, Model Risk). Sitzt der Owner im Projektteam, verliert die Guardrail gegen die Deadline.

Klarna ist der öffentliche Beleg dafür, was passiert, wenn nur die Value-Hälfte gemessen wird. Der Assistent startete im Februar 2024 und führte 2,3 Millionen Kundengespräche, zwei Drittel aller Kundenservice-Chats von Klarna. Laut Klarna entsprach dieses Volumen der Arbeit von 700 Vollzeitkräften. Vierzehn Monate später, am 8. Mai 2025, sagte CEO Sebastian Siemiatkowski gegenüber Bloomberg: „Da Kosten bei der Organisation leider ein zu dominanter Bewertungsfaktor gewesen zu sein scheinen, bekommt man am Ende eine geringere Qualität.“ Eine Post-mortem-Analyse fasste es so zusammen: Die Metriken, mit denen das Deployment zum Launch bewertet wurde, maßen nicht das, was am Ende darüber entschied, ob es funktionierte. Der Assistent rechnet sich trotzdem. Im Earnings Call zum dritten Quartal 2025 meldete Klarna, dass der Assistent die Arbeit von 853 Agents erledigt, nach zuvor 700, bei Einsparungen von 60 Millionen US-Dollar. Klarnas Value-Metrik zeigte innerhalb eines Monats Ergebnisse, während die Evidenz zur Qualitätsmetrik mehr als ein Jahr brauchte.

Die Dreierregel legt Ihre Mindeststichprobe fest

Der Mechanismus ist einfache Statistik. Macht ein Agent bei *n* unabhängigen Fällen null Fehler, liegt die obere 95-%-Grenze seiner wahren Fehlerquote bei etwa 3/*n*. Um zu behaupten „dieser Agent übersieht weniger als 1 % der Fälle, die eskaliert werden sollten“, brauchen Sie rund 300 eskalationswürdige Fälle ohne einen einzigen Fehlgriff. Sie brauchen nicht 300 Fälle insgesamt. Sie brauchen 300 von der seltenen Sorte.

Deshalb hängt die Evidenzuhr von Basisraten ab. Seltene schlechte Ergebnisse, also genau die, die Regulatoren am meisten interessieren, brauchen am längsten, bis man sie beobachtet.

Ein Rechenbeispiel: AML-Alert-Triage (hypothetisch)

Diese Zahlen sind reine Beispielrechnung. Sie beschreiben kein reales Unternehmen.

Ein Payments-EMI leitet monatlich 4.000 Alerts aus dem Transaktionsmonitoring an einen Agenten im Shadow Mode: Der Agent empfiehlt Schließen oder Eskalieren, die Entscheidung treffen weiterhin menschliche Analysten. Historisch werden 2 % der Alerts zur Untersuchung eskaliert, es kommen also jeden Monat 80 eskalationswürdige Alerts herein.

  • Benötigte Fälle, um die Quote übersehener Eskalationen unter 1 % zu begrenzen: etwa 300
  • Evidenzuhr: 300 ÷ 80 = 3,75, also rund vier Monate Shadow-Betrieb
  • Plus ein Prüfzyklus des abzeichnenden Gremiums (angenommen, es tagt quartalsweise): bis zu drei weitere Monate
  • Build-Uhr mit fertigem Agent-Tooling: wenige Wochen

Das realistische Datum liegt sechs bis sieben Monate entfernt, und der Build macht davon den kleinsten Teil aus. Will der Vorstand stattdessen eine Grenze von 0,5 %, verdoppelt sich die Stichprobe auf etwa 600 Fälle und die Shadow-Phase wächst auf rund siebeneinhalb Monate. Eine strengere Guardrail verschiebt das Datum stärker als jede Verbesserung am Agenten.

Regulatoren arbeiten mit derselben Uhr. Zur zweiten Kohorte des FCA-Programms AI Live Testing gehören Barclays, Experian, Lloyds und UBS, mit Use Cases wie agentischen Zahlungen, Geldwäscheerkennung und Know Your Customer. Die Bewerbungsphase für diese Runde des AI Live Testing begann im Januar 2026, die Firmen starteten ihre Tests im April. Die Tests enden bis Jahresende, ein Evaluierungsbericht erscheint im ersten Quartal 2027. Das sind rund fünfzehn Monate von der Bewerbung bis zur veröffentlichten Evidenz, und das bei einem Regulator, der die Einführung von KI will. Core-Anbieter staffeln ihre Launches genauso. Beim Financial Crimes AI Agent von FIS, gebaut mit Anthropic, sind BMO und Amalgamated Bank zuerst in der Entwicklung, die allgemeine Verfügbarkeit ist für das zweite Halbjahr 2026 angesetzt.

Am Whiteboard sieht die Regel so aus:

>Go-live-Termin = Build-Zeit + (benötigte Fälle ÷ monatliche Rate des seltenen schlechten Ergebnisses) + ein Abnahmezyklus. Versprechen Sie nie ein Datum, das kürzer ist als der mittlere Term.

Wann ein kurzer Fintech-KI-Zeitplan ehrlich ist und wann nicht

Ein kurzer Zeitplan ist ehrlich, wenn ein Mensch jeden Output prüft, bevor er einen Kunden oder ein Hauptbuch betrifft, wenn die Aktion umkehrbar ist und wenn keine regulierte Entscheidung davon abhängt. Zusammenfassungen von KYC-Akten für Analysten, Antwortentwürfe, die ein Servicemitarbeiter überarbeitet, und interne BI-Abfragen fallen alle darunter. Hier ist das Guardrail-Ergebnis häufig (ein Entwurf, den der Mensch verwirft), also sammelt sich Evidenz in Tagen. Kundenseitiger Chat ist ein Mittelfall. Er kann schnell starten, aber die Offenlegungspflicht nach Artikel 50 gilt bereits, und Klarna hat gezeigt, dass die Guardrail zum Zugang zu einem Menschen ab dem ersten Tag gemessen werden muss.

Ein kurzer Zeitplan ist unehrlich, sobald der Agent etwas abschließt. Dazu gehören Kreditablehnungen, das Schließen eines AML-Alerts, das Freigeben oder Blockieren einer Zahlung und das Erledigen einer Beschwerde. In diesen Fällen ist das schlechte Ergebnis per Design selten, also ist die Evidenzuhr per Design lang.

Lesen Sie Zeitpläne von Anbietern mit dieser Unterscheidung im Kopf. Gradient Labs, das KI-Agenten an Banken verkauft, sagt, es gehe in Tagen live, wobei das eigene Delivery-Team die Migration von Ihrer bestehenden Lösung übernimmt, und sichert das Deployment mit einer Geld-zurück-Garantie für jeden definierten Use Case ab. Assistents.ai, ein weiterer Anbieter, nennt eine Spanne von unter vier Wochen für Plattformen mit vorgefertigten Finanz-Connectoren und domänenspezifischen Agenten bis zu sechs bis zwölf Monaten für Plattformen, die individuelles Modelltraining und Integrationsarbeit erfordern. Beides sind kommerzielle Aussagen, und beide beschreiben die Build-Uhr. Keiner der beiden Anbieter kann Ihre Evidenzuhr verkürzen, denn die Evidenzuhr hängt von Ihren Alert-Volumen und Ihren Basisraten ab.

Die Methode hat echte Kosten:

  • Shadow Mode heißt doppelt zahlen, für den Agenten und für die Analysten, deren Entscheidungen weiterhin zählen. Bilden Sie diese Monate ehrlich in einem ROI-Modell ab, das die Shadow-Phase einpreist, sonst sieht der Business Case in Monat drei kaputt aus.
  • Teams können die Uhr austricksen, indem sie eine häufige Guardrail wählen („Agent-Output vom Analysten bearbeitet“) statt der seltenen, auf die es ankommt („SAR-würdige Aktivität übersehen“). Aufgabe des Guardrail-Owners ist es, diesen Austausch zu verhindern.
  • Die Evidenzuhr kann zum Dauerpilot werden. Wenn keine Zahl je gut genug ist, haben Sie ein Governance-Problem. Die Regel braucht eine Schwelle, die vor Beginn der Shadow-Phase vereinbart wird.
  • Die Grenzen nach der Dreierregel setzen annähernd unabhängige Fälle voraus. Betrugsringe und Money-Mule-Netzwerke treten gehäuft auf, behandeln Sie die Stichprobe also als Minimum.

Was Sie am Montag tun

  • Notieren Sie für jeden KI-Use-Case auf Ihrer Roadmap das schlimmste einzelne Ergebnis und seine monatliche Basisrate aus den letzten zwölf Monaten Produktionsdaten.
  • Berechnen Sie die Evidenzuhr mit 3 ÷ Zielrate, geteilt durch das monatliche Volumen dieses Ergebnisses. Ersetzen Sie jeden Go-live-Termin, der kürzer ist als das Ergebnis.
  • Benennen Sie für jeden Use Case einen Guardrail-Owner außerhalb des Delivery-Teams und holen Sie seine Akzeptanzschwelle schriftlich ein, bevor der Shadow Mode beginnt.
  • Strukturieren Sie Meilensteine mit Anbietern, ob Nous, Gradient Labs oder andere, in drei Stufen um: Shadow, beaufsichtigt, autonom. Machen Sie den Export der Audit-Logs in der ersten Stufe zur vertraglichen Pflicht und nutzen Sie die Prüfungen, bevor ein Agent eine echte Zahlung anfasst, als Tor zur dritten Stufe.
  • Ordnen Sie jedem Use Case seine regulatorische Uhr zu: Artikel 50 ab sofort, Anhang III bis zum 2. Dezember 2027 und für US-Bankpartner ein schriftlicher interner Standard für die generative und agentische KI, die SR 26-2 ausklammert.

Finanzierungsrunden wie die 90 Millionen US-Dollar von Nous machen Agenten jedes Quartal billiger und schneller baubar. An der Zahl eskalationswürdiger Alerts, die Ihr Geschäft pro Monat erzeugt, ändern sie nichts. Berechnen Sie Ihre Evidenzuhr, bevor Sie sich auf ein Datum festlegen.

Der vollständige Kurs zu diesem Sektor: KI im Fintech.

Häufige Fragen

Wie lange dauert es, einen KI-Agenten in einer Bank oder einem Fintech einzuführen?

Mit fertigen Tools lässt sich ein KI-Agent in Tagen oder Wochen bauen und konfigurieren, bis zum autonomen Produktivbetrieb vergehen aber meist Monate. Entscheidend ist die Evidenzuhr: Sie müssen rund 300 beobachtete Fälle des seltenen schlechten Ergebnisses sammeln (etwa einer übersehenen AML-Eskalation), um eine Fehlerquote unter 1 % zu belegen, plus einen Abnahmezyklus von Compliance oder Model Risk.

Welche Erfolgsmetriken sollte ein Fintech für einen KI-Pilot verwenden?

Ein Fintech-KI-Pilot braucht Metrikpaare: eine Value-Metrik wie Bearbeitungszeit oder abgearbeitete Alerts pro Analyst und eine Guardrail-Metrik wie übersehene Eskalationen oder stattgegebene Beschwerden. Die Guardrail sollte jemandem außerhalb des Projektteams gehören. Klarnas Assistent wurde zum Launch vor allem an den Kosten gemessen, und der CEO räumte später ein, dass das die Qualität gesenkt hat.

Gilt SR 26-2 auch für generative KI und LLM-Agenten?

Nein. SR 26-2 und OCC Bulletin 2026-13, am 17. April 2026 als Ersatz für SR 11-7 veröffentlicht, nehmen generative KI und agentische KI ausdrücklich vom Anwendungsbereich aus. Banken und ihre Fintech-Partner müssen deshalb einen eigenen internen Evidenzstandard für LLM-Agenten schreiben, denn Prüfer können weiterhin fragen, was jede autonome Entscheidung gerechtfertigt hat.

Haben Fintechs durch die Verschiebung beim EU AI Act mehr Zeit für KI-gestütztes Kredit-Scoring?

Teilweise. Der Digital Omnibus hat die Hochrisiko-Pflichten nach Anhang III, zu denen die Bonitätsprüfung gehört, von August 2026 auf den 2. Dezember 2027 verschoben. Die Transparenzpflichten nach Artikel 50 für kundenseitige Chatbots gelten seit dem 2. August 2026, und Verstöße im Hochrisikobereich können ab der neuen Frist bis zu 15 Millionen € oder 3 % des weltweiten Umsatzes kosten.

Mehr dazu

Die Lektionen, die diesen Artikel weiterführen, frei zugänglich.

  1. 1Realistische Zeitpläne und Erfolgsmetriken festlegenKI im Fintech-Bereich
  2. 2Warum die meisten KI-Piloten im Fintech nie skalierenKI im Fintech-Bereich
  3. 3Ein ROI-Modell für eine KI-Initiative aufbauenKI im Fintech-Bereich
  4. 4Scoping, Daten und ErfolgskriterienBuilding with AI
  5. 5Die Pre-Deployment-Checkliste, bevor KI Geld anfasstKI im Fintech-Bereich

Sources

Artikel gelesen?

Bestätigen Sie Ihre Lektüre, um XP zu sammeln und Ihr Radar zu füttern.