Fintech-KI nach der Evidenzuhr terminieren
Anbieter von Fintech-KI versprechen inzwischen ein Go-live in wenigen Tagen, doch der Bau des Agenten war nie der Grund für verspätete Projekte. In der regulierten Finanzbranche ist der realistische Zeitplan die Zeit, die Sie brauchen, um genug beobachtete Ergebnisse auf Ihrer Worst-Case-Metrik zu sammeln. Dieser Beitrag zeigt, wie Sie diese Zeit berechnen.
Neo NeumannAI Practice Lead8. Oktober 2026
Fragen Sie im Oktober 2026 einen Anbieter von Fintech-KI, wie lange das Deployment dauert, und Sie bekommen eine Antwort in Tagen oder Wochen. Fragen Sie Ihren MLRO oder Ihre Leitung Model Risk, bekommen Sie eine andere Antwort, meist ohne Zahl. Die Lücke hat einen Namen: die Evidenzuhr. Gemeint ist die Zeit, die ein produktives KI-System braucht, um genug beobachtete Ergebnisse auf der Metrik zu liefern, die Ihre Kontrollfunktionen interessiert, damit es handeln darf, ohne dass ein Mensch jeden Fall prüft.
Meine These: In der regulierten Finanzbranche bestimmt die Evidenzuhr den realistischen Zeitplan, und wie selten Ihr schlimmstes Ergebnis ist, bestimmt die Evidenzuhr. Modellqualität und Build-Geschwindigkeit zählen viel weniger. Die Wahl der Erfolgsmetrik und die Wahl des Launch-Termins sind deshalb eine einzige Entscheidung. Steht die GuardrailGuardrailRegeln und Kontrollen, die ein KI-System in sicheren, rechtskonformen und markengerechten Grenzen halten und unerwünschte Ausgaben blockieren.Vollständige Definition ansehen →-Metrik fest, ergibt sich das Datum aus der Arithmetik.
Warum Hermes for Businesses Fintech-KI-Zeitpläne nicht verkürzt
Die Build-Uhr wird immer kkDie durchschnittliche Zahl neuer Nutzer, die jeder bestehende Nutzer über Empfehlungen generiert. Über 1,0 verstärkt sich das Wachstum selbst und wird exponentiell.Vollständige Definition ansehen →ürzer. Gestern, am 7. Oktober, bestätigte Nous Research den Abschluss einer Series B über 90 Millionen US-Dollar bei einer Bewertung von 1,5 Milliarden US-Dollar. Zusammen mit der Ankündigung startete das Unternehmen Hermes for Businesses, einen Vorstoß, seinen Open-Source-Agenten Hermes direkt an Unternehmen zu verkaufen. Das Paket umfasst private Deployment, Single Sign-On, Auditing, Workspace-Kontrollen, gemeinsame Team-Skills, Kostentransparenz und Service-Level-Agreements. Genau diese Funktionen fragt ein Fintech-CISO zuerst ab. Der kommerzielle Schwung ist groß: Laut The Wall Street Journal lag Nous Mitte September 2026 bei rund 36 Millionen US-Dollar annualisiertem Umsatz und erwartet, vor Ende 2026 die Marke von 100 Millionen US-Dollar zu überschreiten. Die Angaben zur Verbreitung sollten Sie vorsichtig lesen. Die Zahl, wonach Hermes rund 2,5 % der weltweiten KI-TokenTokenEin Token ist die grundlegende Texteinheit, die Sprachmodelle verarbeiten, oft ein Wortfragment, ein ganzes Wort oder ein Satzzeichen und nicht ein einzelnes Zeichen.Vollständige Definition ansehen →-Nutzung ausmacht, stammt von Nous selbst und wurde nicht unabhängig überprüft.
Solche Bewertungen setzen alle in der Kette unter Druck. Dealroom merkte bei der ersten Meldung der Runde an, dass Unternehmen, die zu solchen Zahlen Kapital aufnehmen, schnell messbaren Nutzen nachweisen müssen, und dass autonome Agenten sich in vielen realen Workflows noch nicht bewährt haben. Bei Ihnen kommt dieser Druck als Sales-Pitch an: Der Agent ist fertig, warum ist ererDas Verhältnis von Interaktionen (Likes, Kommentare, Shares) zur Reichweite eines Inhalts. Zeigt, wie stark die Zielgruppe reagiert, gemessen an der Zahl der Personen, die den Inhalt gesehen haben.Vollständige Definition ansehen → nicht live?
Fintech ist anders, weil es dem Kontrollumfeld egal ist, wie schnell der Agent konfiguriert wurde. Drei Fakten aus 2026 machen das konkret.
- In den USA gibt es keine Vorlage mehr. Am 17. April 2026 veröffentlichten das Office of the Comptroller of the Currency, das Federal Reserve Board und die Federal Deposit Insurance Corporation gemeinsam eine überarbeitete interagency guidance, die das Framework von 2011 vollständig aufhebt, und in der Nachfolgeregelung (SR 26-2 / OCC Bulletin 2026-13) sind generative KI und agentische KI-Modelle ausdrücklich vom Anwendungsbereich ausgenommen. Wenn Sie einen LLMLLMEin Large Language Model ist ein KI-System, das auf riesigen Textmengen trainiert wurde, um Sprache vorherzusagen und zu erzeugen. Damit sind Aufgaben wie Schreiben, Zusammenfassen und Beantworten von Fragen möglich.Vollständige Definition ansehen →-Agenten bei einer Bank oder einem Fintech mit Bankpartner einsetzen, gibt Ihnen niemand einen vorgeschriebenen Validierungspfad. Sie müssen Ihren eigenen Evidenzstandard schreiben und dann zeigen, dass Sie ihn erfüllt haben.
- In der EU hat sich die Uhr verschoben, läuft aber weiter. Der Digital Omnibus hat die Hochrisiko-Pflichten nach Anhang III, die das Kredit-Scoring umfassen, von August 2026 auf den 2. Dezember 2027 verschoben, während die Transparenzpflichten nach Artikel 50 unverändert blieben und seit dem 2. August 2026 gelten. Verstöße im Hochrisikobereich kosten bis zu 15 Millionen € oder 3 % des weltweiten Umsatzes.
- Die Konkurrenz ist schneller. Die globale Umfrage 2026 des Cambridge Centre for Alternative Finance ergab, dass Fintechs bei der Einführung fortgeschrittener KI mit 47 % zu 30 % vor etablierten Instituten liegen und dass Fintechs auch hier besser abschneiden: 56 % melden höhere Profitabilität, gegenüber 34 % der traditionellen Finanzinstitute. Laut demselben Bericht sehen derzeit nur 14 % KI als transformativ für ihre Unternehmensstrategie und ihren Wettbewerbsvorteil.
Sie haben es also mit einem Vorstand zu tun, der Wettbewerber liefern sieht und Anbieter Tage versprechen hört, und mit Prüfern, die fragen werden, welche Evidenz jede autonome Entscheidung gerechtfertigt hat. Mit der Evidenzuhr geben Sie beiden ein Datum, das Sie verteidigen können.
Wie funktioniert die Evidenzuhr bei einem Fintech-KI-Rollout?
Die Evidenzuhr ist die Zahl realer Fälle Ihres schlimmsten Ergebnisses, die Sie beobachten müssen, geteilt durch die Zahl solcher Fälle, die Ihr Volumen pro Monat erzeugt, plus der Prüfzyklus derjenigen, die abzeichnen. Die einzelnen Bestandteile werden unten beschrieben.
Jede Value-Metrik braucht eine Guardrail, die jemand anderem gehört
Eine Erfolgsmetrik für Fintech-KI hat zwei Hälften. Die Value-Hälfte ist das, was der Business Case verspricht: Bearbeitungszeit, abgearbeitete Alerts pro Analyst, Kosten pro gelöstem Dispute. Die Guardrail-Hälfte ist der Schaden, der den Regulator interessieren würde: übersehene verdächtige Aktivitäten, falsche Ablehnungsgründe, stattgegebene Beschwerden, Kunden, die keinen Menschen erreichen konnten. Die Guardrail braucht einen Owner außerhalb des Projektteams (Compliance in der zweiten Verteidigungslinie, MLRO, Model Risk). Sitzt der Owner im Projektteam, verliert die Guardrail gegen die Deadline.
Klarna ist der öffentliche Beleg dafür, was passiert, wenn nur die Value-Hälfte gemessen wird. Der Assistent startete im Februar 2024 und führte 2,3 Millionen Kundengespräche, zwei Drittel aller Kundenservice-Chats von Klarna. Laut Klarna entsprach dieses Volumen der Arbeit von 700 Vollzeitkräften. Vierzehn Monate später, am 8. Mai 2025, sagte CEO Sebastian Siemiatkowski gegenüber Bloomberg: „Da Kosten bei der Organisation leider ein zu dominanter Bewertungsfaktor gewesen zu sein scheinen, bekommt man am Ende eine geringere Qualität.“ Eine Post-mortem-Analyse fasste es so zusammen: Die Metriken, mit denen das Deployment zum Launch bewertet wurde, mamaEinsatz von Software, um wiederkehrende Marketingaufgaben und Kampagnen zu automatisieren und Personalisierung in großem Maßstab über Kanäle wie E-Mail, Web und Social zu ermöglichen.Vollständige Definition ansehen →ßen nicht das, was am Ende darüber entschied, ob es funktionierte. Der Assistent rechnet sich trotzdem. Im Earnings Call zum dritten Quartal 2025 meldete Klarna, dass der Assistent die Arbeit von 853 Agents erledigt, nach zuvor 700, bei Einsparungen von 60 Millionen US-Dollar. Klarnas Value-Metrik zeigte innerhalb eines Monats Ergebnisse, während die Evidenz zur Qualitätsmetrik mehr als ein Jahr brauchte.
Die Dreierregel legt Ihre Mindeststichprobe fest
Der Mechanismus ist einfache Statistik. Macht ein Agent bei *n* unabhängigen Fällen null Fehler, liegt die obere 95-%-Grenze seiner wahren Fehlerquote bei etwa 3/*n*. Um zu behaupten „dieser Agent übersieht weniger als 1 % der Fälle, die eskaliert werden sollten“, brauchen Sie rund 300 eskalationswürdige Fälle ohne einen einzigen Fehlgriff. Sie brauchen nicht 300 Fälle insgesamt. Sie brauchen 300 von der seltenen Sorte.
Deshalb hängt die Evidenzuhr von Basisraten ab. Seltene schlechte Ergebnisse, also genau die, die Regulatoren am meisten interessieren, brauchen am längsten, bis man sie beobachtet.
Ein Rechenbeispiel: AML-Alert-Triage (hypothetisch)
Diese Zahlen sind reine Beispielrechnung. Sie beschreiben kein reales Unternehmen.
Ein Payments-EMI leitet monatlich 4.000 Alerts aus dem Transaktionsmonitoring an einen Agenten im Shadow Mode: Der Agent empfiehlt Schließen oder Eskalieren, die Entscheidung treffen weiterhin menschliche Analysten. Historisch werden 2 % der Alerts zur Untersuchung eskaliert, es kommen also jeden Monat 80 eskalationswürdige Alerts herein.
- Benötigte Fälle, um die Quote übersehener Eskalationen unter 1 % zu begrenzen: etwa 300
- Evidenzuhr: 300 ÷ 80 = 3,75, also rund vier Monate Shadow-Betrieb
- Plus ein Prüfzyklus des abzeichnenden Gremiums (angenommen, es tagt quartalsweise): bis zu drei weitere Monate
- Build-Uhr mit fertigem Agent-Tooling: wenige Wochen
Das realistische Datum liegt sechs bis sieben Monate entfernt, und der Build macht davon den kleinsten Teil aus. Will der Vorstand stattdessen eine Grenze von 0,5 %, verdoppelt sich die Stichprobe auf etwa 600 Fälle und die Shadow-Phase wächst auf rund siebeneinhalb Monate. Eine strengere Guardrail verschiebt das Datum stärker als jede Verbesserung am Agenten.
Regulatoren arbeiten mit derselben Uhr. Zur zweiten Kohorte des FCA-Programms AI Live Testing gehören Barclays, Experian, Lloyds und UBS, mit Use Cases wie agentischen Zahlungen, Geldwäscheerkennung und Know Your Customer. Die Bewerbungsphase für diese Runde des AI Live Testing begann im Januar 2026, die Firmen starteten ihre Tests im April. Die Tests enden bis Jahresende, ein Evaluierungsbericht erscheint im ersten Quartal 2027. Das sind rund fünfzehn Monate von der Bewerbung bis zur veröffentlichten Evidenz, und das bei einem Regulator, der die Einführung von KI will. Core-Anbieter staffeln ihre Launches genauso. Beim Financial Crimes AI AgentAI AgentSoftware, die ein Ziel eigenständig verfolgt: Sie plant Schritte, nutzt Werkzeuge und handelt mit wenig menschlichem Eingriff.Vollständige Definition ansehen → von FIS, gebaut mit Anthropic, sind BMO und Amalgamated Bank zuerst in der Entwicklung, die allgemeine Verfügbarkeit ist für das zweite Halbjahr 2026 angesetzt.
Am Whiteboard sieht die Regel so aus:
>Go-live-Termin = Build-Zeit + (benötigte Fälle ÷ monatliche Rate des seltenen schlechten Ergebnisses) + ein Abnahmezyklus. Versprechen Sie nie ein Datum, das kürzer ist als der mittlere Term.
Wann ein kurzer Fintech-KI-Zeitplan ehrlich ist und wann nicht
Ein kurzer Zeitplan ist ehrlich, wenn ein Mensch jeden Output prüft, bevor er einen Kunden oder ein Hauptbuch betrifft, wenn die Aktion umkehrbar ist und wenn keine regulierte Entscheidung davon abhängt. Zusammenfassungen von KYC-Akten für Analysten, Antwortentwürfe, die ein Servicemitarbeiter überarbeitet, und interne BIBITechnologien und Prozesse, die Rohdaten über Reporting, Dashboards und Analysen in verwertbare Insights überführen, damit Teams auf Basis von Fakten statt Intuition entscheiden.Vollständige Definition ansehen →-Abfragen fallen alle darunter. Hier ist das Guardrail-Ergebnis häufig (ein Entwurf, den der Mensch verwirft), also sammelt sich Evidenz in Tagen. Kundenseitiger Chat ist ein Mittelfall. Er kann schnell starten, aber die Offenlegungspflicht nach Artikel 50 gilt bereits, und Klarna hat gezeigt, dass die Guardrail zum Zugang zu einem Menschen ab dem ersten Tag gemessen werden muss.
Ein kurzer Zeitplan ist unehrlich, sobald der Agent etwas abschließt. Dazu gehören Kreditablehnungen, das Schließen eines AML-Alerts, das Freigeben oder Blockieren einer Zahlung und das Erledigen einer Beschwerde. In diesen Fällen ist das schlechte Ergebnis per Design selten, also ist die Evidenzuhr per Design lang.
Lesen Sie Zeitpläne von Anbietern mit dieser Unterscheidung im Kopf. Gradient Labs, das KI-Agenten an Banken verkauft, sagt, es gehe in Tagen live, wobei das eigene Delivery-Team die Migration von Ihrer bestehenden Lösung übernimmt, und sichert das Deployment mit einer Geld-zurück-Garantie für jeden definierten Use Case ab. Assistents.ai, ein weiterer Anbieter, nennt eine Spanne von unter vier Wochen für Plattformen mit vorgefertigten Finanz-Connectoren und domänenspezifischen Agenten bis zu sechs bis zwölf Monaten für Plattformen, die individuelles Modelltraining und Integrationsarbeit erfordern. Beides sind kommerzielle Aussagen, und beide beschreiben die Build-Uhr. Keiner der beiden Anbieter kann Ihre Evidenzuhr verkürzen, denn die Evidenzuhr hängt von Ihren Alert-Volumen und Ihren Basisraten ab.
Die Methode hat echte Kosten:
- Shadow Mode heißt doppelt zahlen, für den Agenten und für die Analysten, deren Entscheidungen weiterhin zählen. Bilden Sie diese Monate ehrlich in einem ROIROIReturn on Investment: das Verhältnis von Nettogewinn zu den Kosten einer Investition. Ein ROI von 300 % bedeutet, dass jeder investierte Dollar 3 Dollar zurückbringt.Vollständige Definition ansehen →-Modell ab, das die Shadow-Phase einpreist, sonst sieht der Business Case in Monat drei kaputt aus.
- Teams können die Uhr austricksen, indem sie eine häufige Guardrail wählen („Agent-Output vom Analysten bearbeitet“) statt der seltenen, auf die es ankommt („SAR-würdige Aktivität übersehen“). Aufgabe des Guardrail-Owners ist es, diesen Austausch zu verhindern.
- Die Evidenzuhr kann zum Dauerpilot werden. Wenn keine Zahl je gut genug ist, haben Sie ein Governance-Problem. Die Regel braucht eine Schwelle, die vor Beginn der Shadow-Phase vereinbart wird.
- Die Grenzen nach der Dreierregel setzen annähernd unabhängige Fälle voraus. Betrugsringe und Money-Mule-Netzwerke treten gehäuft auf, behandeln Sie die Stichprobe also als Minimum.
Was Sie am Montag tun
- Notieren Sie für jeden KI-Use-Case auf Ihrer Roadmap das schlimmste einzelne Ergebnis und seine monatliche Basisrate aus den letzten zwölf Monaten Produktionsdaten.
- Berechnen Sie die Evidenzuhr mit 3 ÷ Zielrate, geteilt durch das monatliche Volumen dieses Ergebnisses. Ersetzen Sie jeden Go-live-Termin, der kürzer ist als das Ergebnis.
- Benennen Sie für jeden Use Case einen Guardrail-Owner außerhalb des Delivery-Teams und holen Sie seine Akzeptanzschwelle schriftlich ein, bevor der Shadow Mode beginnt.
- Strukturieren Sie Meilensteine mit Anbietern, ob Nous, Gradient Labs oder andere, in drei Stufen um: Shadow, beaufsichtigt, autonom. Machen Sie den Export der Audit-Logs in der ersten Stufe zur vertraglichen Pflicht und nutzen Sie die Prüfungen, bevor ein Agent eine echte Zahlung anfasst, als Tor zur dritten Stufe.
- Ordnen Sie jedem Use Case seine regulatorische Uhr zu: Artikel 50 ab sofort, Anhang III bis zum 2. Dezember 2027 und für US-Bankpartner ein schriftlicher interner Standard für die generative und agentische KI, die SR 26-2 ausklammert.
Finanzierungsrunden wie die 90 Millionen US-Dollar von Nous machen Agenten jedes Quartal billiger und schneller baubar. An der Zahl eskalationswürdiger Alerts, die Ihr Geschäft pro Monat erzeugt, ändern sie nichts. Berechnen Sie Ihre Evidenzuhr, bevor Sie sich auf ein Datum festlegen.
Der vollständige Kurs zu diesem Sektor: KI im Fintech.
Häufige Fragen
Wie lange dauert es, einen KI-Agenten in einer Bank oder einem Fintech einzuführen?
Mit fertigen Tools lässt sich ein KI-Agent in Tagen oder Wochen bauen und konfigurieren, bis zum autonomen Produktivbetrieb vergehen aber meist Monate. Entscheidend ist die Evidenzuhr: Sie müssen rund 300 beobachtete Fälle des seltenen schlechten Ergebnisses sammeln (etwa einer übersehenen AML-Eskalation), um eine Fehlerquote unter 1 % zu belegen, plus einen Abnahmezyklus von Compliance oder Model Risk.
Welche Erfolgsmetriken sollte ein Fintech für einen KI-Pilot verwenden?
Ein Fintech-KI-Pilot braucht Metrikpaare: eine Value-Metrik wie Bearbeitungszeit oder abgearbeitete Alerts pro Analyst und eine Guardrail-Metrik wie übersehene Eskalationen oder stattgegebene Beschwerden. Die Guardrail sollte jemandem außerhalb des Projektteams gehören. Klarnas Assistent wurde zum Launch vor allem an den Kosten gemessen, und der CEO räumte später ein, dass das die Qualität gesenkt hat.
Gilt SR 26-2 auch für generative KI und LLM-Agenten?
Nein. SR 26-2 und OCC Bulletin 2026-13, am 17. April 2026 als Ersatz für SR 11-7 veröffentlicht, nehmen generative KI und agentische KI ausdrücklich vom Anwendungsbereich aus. Banken und ihre Fintech-Partner müssen deshalb einen eigenen internen Evidenzstandard für LLM-Agenten schreiben, denn Prüfer können weiterhin fragen, was jede autonome Entscheidung gerechtfertigt hat.
Haben Fintechs durch die Verschiebung beim EU AI Act mehr Zeit für KI-gestütztes Kredit-Scoring?
Teilweise. Der Digital Omnibus hat die Hochrisiko-Pflichten nach Anhang III, zu denen die Bonitätsprüfung gehört, von August 2026 auf den 2. Dezember 2027 verschoben. Die Transparenzpflichten nach Artikel 50 für kundenseitige Chatbots gelten seit dem 2. August 2026, und Verstöße im Hochrisikobereich können ab der neuen Frist bis zu 15 Millionen € oder 3 % des weltweiten Umsatzes kosten.
Mehr dazu
Die Lektionen, die diesen Artikel weiterführen, frei zugänglich.
- 1Realistische Zeitpläne und Erfolgsmetriken festlegenKI im Fintech-Bereich
- 2Warum die meisten KI-Piloten im Fintech nie skalierenKI im Fintech-Bereich
- 3Ein ROI-Modell für eine KI-Initiative aufbauenKI im Fintech-Bereich
- 4Scoping, Daten und ErfolgskriterienBuilding with AI
- 5Die Pre-Deployment-Checkliste, bevor KI Geld anfasstKI im Fintech-Bereich
Sources
- Nous Research confirms $1.5 billion valuation and launches business AI agents - Startup Fortune
- Nous Research Raises $90 Million for Hermes Agent Business Expansion
- Nous Research confirms it hit $1.5B valuation, launches AI agents for business users · Issue #1401 · hanzhad/squelch-news-engine
- Nous Research raises $75M Series B at $1.5B valuation
- SR 11-7 Rescinded: What Replaced It and the AI Gap
- Revised Guidance on Model Risk Management (2026)
- EU AI Act High-Risk Deadline Delayed to December 2027
- EU AI Act high-risk deadline moved to 2027. What didn't?
- 2026 Global AI in Financial Services Report
- Report finds uneven AI adoption in financial services — Financial Innovation for Impact
- Klarna AI Assistant: Two-Thirds of Support Automated (2026)
- Klarna's AI customer service deployment
- Klarna Said Its AI Did the Work of 700 People. Then It Started Hiring Humans Again - Geeky Codes
- FCA announces second cohort for AI Live Testing
- FCA selects eight firms for second round of AI live testing - The Intermediary - Latest UK mortgage news
- FCA announces second cohort for AI live testing - Professional Paraplanner
- Sector Spotlight: AI Agents and Connectors for Banks and Credit Unions
- Best secure AI agents for banking in 2026
- 11 Best AI Agents for Financial Services in 2026
- Nous Research confirms it hit $1.5B valuation, launches AI agents for business users
- ChatGPT with GPT-6 ditches mostly text output for interactive UI with charts, buttons, and mini apps
- Claude Haiku 5.5 arrives with massive price cuts proving the AI pricing arms race is far from over
- ChatGPT for Teens keeps teens talking, even during mental health crises
- ChatGPT is getting a lot more visual, with the launch of a new interface
- Meta rolls out new AI tools to detect ads that secretly lead to child sexual abuse material
- OpenAI launches Decisions API that reduces complex evaluations to yes, no, or pick one
- Google bets Gemini can turn casual players into game developers with new Playground feature
- ML Engineer, AI Engineer, or LLM Engineer: Which Role Actually Builds What in 2026?
- One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO
- ChatGPT rated "unacceptable risk" for teens after parental alerts failed during suicide conversations
- Anthropic gives more security teams access to Claude with fewer safety restrictions
- I Tested 5 AI Coding Assistants for a Month: Here’s What I Actually Found
- Helping teens learn, plan, and shape the future of AI
Artikel gelesen?
Bestätigen Sie Ihre Lektüre, um XP zu sammeln und Ihr Radar zu füttern.