IAIA dans FintechFintech

Jugez l'IA fintech sur des cohortes mûres

Un agent IA s'installe en une semaine, mais le défaut d'un crédit ou la confirmation d'un soupçon de blanchiment n'apparaît qu'après des mois. Cet article explique la latence de vérité, la notion qui sépare un calendrier IA crédible d'une promesse de démo, et donne une règle de calcul applicable à vos projets.

Immense sablier laissant couler des pièces dans un hall bancaire, quelques pièces rouges en bas, robot et responsable qui attendent.

Nous Research, l'éditeur de l'agent open source Hermes, a confirmé une série B de 90 millions de dollars à une valorisation de 1,5 milliard, ce qui porte son financement total à 158 millions. Selon le Wall Street Journal, l'entreprise atteignait environ 36 millions de dollars de revenu annualisé à la mi-septembre et prévoit de dépasser les 100 millions d'ici fin 2026. La levée finance Hermes for Businesses, qui permettra aux entreprises de faire tourner des agents sur mesure à travers des workflows multi-étapes, avec un meilleur contrôle de l'accès à leurs données sensibles. Dans un comité exécutif de fintech, ces chiffres produisent toujours la même question : si un agent s'installe en une semaine, pourquoi le retour sur investissement demande-t-il un an et demi ?

La réponse tient en une notion que peu d'équipes nomment : lalatence de vérité, c'est-à-dire le délai entre une décision prise par l'IA et le moment où l'on sait si elle était bonne. Voici la thèse de cet article. Dans une fintech, un calendrier réaliste et des métriques de succès crédibles se calent sur la latence de vérité de la métrique principale et sur le cycle de contrôle réglementaire. La vitesse de déploiement de l'outil n'y entre pas. Tout plan qui annonce un succès avant qu'une cohorte complète de décisions ait atteint son issue réelle mesure la démo, pas le produit.

Combien de temps faut-il pour prouver un projet IA en fintech ?

Il faut le temps qu'une cohorte complète de décisions atteigne son issue réelle, plus le temps de validation par vos fonctions de contrôle. Pour un assistant de rédaction interne, cela prend quelques jours. Pour un modèle d'octroi de crédit, on parle de plus d'un an, parce qu'un défaut de paiement ne se constate pas à la signature.

Ce décalage explique une bonne partie des échecs qui remontent aux directions générales. Gartner prévoit que plus de 40 % des projets d'IA agentique seront annulés d'ici fin 2027, en raison de coûts croissants, d'une valeur métier floue ou de contrôles des risques insuffisants. Une « valeur métier floue » signifie très souvent que la métrique de vérité n'était pas encore observable au moment où le comité a tranché. Backbase, éditeur de logiciels bancaires (source commerciale, à croiser), rapporte une enquête Deloitte menée auprès de 1 854 dirigeants : la plupart des organisations obtiennent un ROI satisfaisant sur un cas d'usage IA typique en deux à quatre ans, bien au-delà des sept à douze mois de retour habituellement attendus des investissements technologiques.

Le chiffre le plus cité sur le sujet illustre lui-même le problème. Le taux d'échec de 95 % attribué à l'étude « The GenAI Divide » du MIT se définit comme l'absence de retour financier mesurable dans les six mois. Sur un portefeuille de crédit à la consommation, six mois ne suffisent souvent pas à voir les premiers impayés sérieux. L'horizon de mesure est plus court que la latence de vérité, et le verdict est donc structurellement prématuré.

Le régulateur a sa propre horloge, et elle est lente. Pour la deuxième cohorte de l'AI Live Testing de la FCA britannique, les candidatures ont ouvert en janvier 2026 et les tests ont démarré en avril. Les tests se termineront fin 2026 et le rapport d'évaluation paraîtra au premier trimestre 2027. Les cas testés couvrent l'aide ciblée à l'investissement, les indicateurs de score de crédit pour les consommateurs, les paiements agentiques, la détection anti-blanchiment et le KYC. Barclays, Experian ou GoCardless acceptent donc un cycle d'environ quinze mois entre la candidature et le retour formel du superviseur. Côté européen, le Digital Omnibus a repoussé les obligations à haut risque de l'annexe III, qui couvrent la notation de crédit : ces systèmes doivent désormais être conformes au 2 décembre 2027, au lieu du 2 août 2026. Les obligations de transparence de l'article 50 sont, elles, entrées en vigueur comme prévu le 2 août 2026.

Un responsable IA de fintech travaille donc avec trois horloges : celle de la technique (des semaines), celle du contrôle (des mois) et celle de la vérité (de quelques jours à plus d'un an selon le cas d'usage). Le calendrier qu'il présente doit suivre la plus lente des trois.

La latence de vérité expliquée avec Klarna et HSBC

Le mécanisme se comprend mieux en séparant les métriques en trois niveaux, chacun avec son propre délai d'observation.

  • Les métriques de signal se lisent en quelques jours : volume traité, temps de réponse, taux d'automatisation. Elles disent si l'outil tourne.
  • Les métriques garde-fous se suivent en continu : taux de plaintes, écarts de taux de refus entre segments de clientèle, escalades vers un humain. Elles disent si l'outil abîme quelque chose.
  • Les métriques de vérité n'existent qu'après la latence : défauts à 90 jours, rétrofacturations, déclarations de soupçon confirmées, réclamations fondées. Elles disent si l'outil crée de la valeur.

Klarna a conclu sur le signal

Klarna est l'exemple de référence d'un verdict rendu sur des signaux. L'assistant lancé en février 2024 a traité 2,3 millions de conversations le premier mois et ramené le temps moyen de traitement de 11 minutes à moins de 2 minutes. L'entreprise affirmait qu'il faisait « l'équivalent du travail de 700 agents à temps plein ». Toutes ces métriques étaient des signaux. La vérité est arrivée plus tard : le 8 mai 2025, le PDG Sebastian Siemiatkowski a expliqué à Bloomberg que le coût avait pesé trop lourd dans l'évaluation et que la qualité avait baissé, et Klarna a recommencé à recruter des conseillers humains. Une analyse post-mortem résume bien la cause : Klarna mesurait le volume et le coût, sans mesurer la qualité des résultats clients avec la même rigueur avant de passer à l'échelle. Dans un service financier, une réponse fausse sur des frais ou un échéancier de paiement relève de la conformité (règles de transparence, protection du consommateur), et pas seulement de la satisfaction client.

HSBC a attendu la vérité

HSBC montre le cas inverse. En lutte anti-blanchiment, la vérité est un soupçon confirmé après enquête, et chaque enquête prend du temps. La banque a commencé à tester l'outil de Google Cloud en 2019, et les résultats n'ont été publiés qu'au lancement commercial du produit en 2023. Selon les chiffres mesurés par HSBC et diffusés par Google Cloud, qui vend la solution (chiffres à lire avec cette réserve), l'outil a identifié 2 à 4 fois plus d'activité suspecte tout en réduisant de plus de 60 % le volume d'alertes. HSBC indique aussi avoir ramené de plusieurs semaines à quelques jours le temps de traitement de milliards de transactions sur des millions de comptes. Environ quatre ans séparent le premier test de la publication du résultat. Ce délai correspond au rythme normal d'un cas d'usage à forte latence de vérité, dans une fonction examinée de près par les superviseurs.

Un exemple chiffré (hypothétique)

Prenons une néobanque fictive qui déploie un agent pour pré-instruire des dossiers de crédit aux TPE. Toutes les durées ci-dessous sont des hypothèses de travail, et seule l'arithmétique compte :

  • construction et intégration de l'agent : 1 mois ;
  • validation par le risque modèle, analyse d'impact RGPD avec le DPO, revue conformité : 3 mois ;
  • constitution d'une cohorte de dossiers assez nombreuse pour être lisible : 3 mois ;
  • latence de vérité, avec comme métrique les impayés à 90 jours observés sur 6 mois : 6 mois.

Le verdict honnête tombe donc au bout de 1 + 3 + 3 + 6 = 13 mois. Si le comité a reçu une promesse de résultats « au trimestre », le projet sera jugé décevant au mois 3, alors que rien de mesurable n'existait encore. Les signaux (délai de première réponse, part de dossiers pré-instruits) seront pourtant visibles dès le deuxième mois, en mode fantôme.

D'où la règle à écrire au tableau :

Date de verdict = mise en production + constitution d'une cohorte + latence de vérité. Avant cette date, on ne présente que des signaux et des garde-fous.

C'est la règle de la cohorte mûre. Elle n'interdit pas de piloter vite. Elle interdit d'appeler « succès » ce qui n'est qu'un signal. C'est souvent à ce moment précis queles pilotes IA des fintechs restent bloqués avant la production : le budget du pilote s'épuise avant que la vérité soit observable.

Quand appliquer la règle de la cohorte mûre, et quand elle freine

La règle est à appliquer chaque fois que l'issue d'une décision tombe après la décision elle-même. Cela couvre l'octroi et le pricing du crédit, le scoring de fraude (les rétrofacturations arrivent des semaines ou des mois après la transaction), la priorisation des alertes AML, le recouvrement et le conseil en investissement. Sur ces cas, présenter un ROI avant maturité de la cohorte expose la direction à une contradiction devant le conseil, puis devant le superviseur.

Elle devient un frein dans deux situations.

Première situation : la latence de vérité est quasi nulle. Un agent qui prépare des rapprochements comptables, rédige un premier jet de reporting réglementaire ou assiste les développeurs est vérifié par un humain au moment même de la relecture. Le signal et la vérité y coïncident presque. Attendre une « cohorte » n'a alors aucun sens : le goulot est l'adoption, et il faut mesurer vite et arbitrer vite. Gartner le formule à sa manière : « beaucoup de cas d'usage présentés comme agentiques aujourd'hui n'ont pas besoin d'une implémentation agentique ».

Seconde situation : vous disposez d'historique mûr. Rejouer l'agent sur des dossiers de 2024 ou 2025 dont l'issue est connue (backtesting) fournit une estimation précoce de la vérité. C'est le meilleur moyen de compresser le calendrier. Cette méthode a deux limites. La première est connue : l'historique reflète vos anciennes politiques d'octroi, avec leurs biais de sélection, puisque vous ne savez pas comment les dossiers refusés auraient tourné. La seconde est propre aux agents génératifs : un agent qui change de comportement en cours de route rend la cohorte obsolète. Hermes, par exemple, conserve une mémoire persistante entre les sessions et génère ses propres compétences réutilisables au fil du travail. Pour un usage réglementé, chaque nouvelle compétence est une nouvelle version du système. Si vous ne figez pas la version, ou si vous ne tracez pas les compétences ajoutées, la cohorte que vous mesurez au mois 13 a été traitée par un agent qui n'existe plus. Nous Research semble l'avoir anticipé : la couche entreprise ajoute SSO, permissions par employé, isolation des espaces de travail, audit, gestion des coûts et intégrations Slack et Teams. Pour un responsable IA de fintech, la fonction d'audit pèse plus lourd dans le choix que la vitesse d'installation.

Un dernier arbitrage concerne le coût. Le prix des modèles baisse par paliers, comme l'a encore montré la sortie de Claude Haiku 5.5 avec de fortes baisses tarifaires. Un « coût par dossier » placé comme métrique de succès devant le conseil s'améliorera tout seul, sans rapport avec la qualité du projet. Mieux vaut le suivre comme signal et réserver la ligne « succès » aux métriques de vérité : pertes évitées, faux positifs AML en moins à détection constante, réclamations fondées en baisse. Ce sont aussi celles qui alimentent unmodèle de ROI défendable devant un comité des risques.

Le dossier Nous Research rappelle enfin que l'horloge du fournisseur n'est pas la vôtre. Dealroom note qu'à ce niveau de valorisation, les entreprises doivent prouver rapidement une valeur mesurable, alors que les agents autonomes restent non éprouvés dans de nombreux workflows réels. Un éditeur qui vise plus de 100 millions de revenu annualisé d'ici décembre a intérêt à vous vendre des signaux rapides. Votre superviseur, lui, vous jugera sur les métriques de vérité.

Ce qu'il faut faire lundi

  • Pour chaque projet IA en cours, notez sur une ligne la métrique de vérité et sa latence en jours. Si personne ne sait la nommer, le projet n'a pas encore de critère de succès.
  • Recalculez la date de verdict de chaque projet avec la règle de la cohorte mûre, puis comparez-la à la date promise au comité. L'écart entre les deux est votre risque de crédibilité.
  • Refondez le reporting du comité IA en trois colonnes (signal, garde-fou, vérité), en laissant la troisième vide tant que la cohorte n'est pas mûre.
  • Fixez pour chaque cas client un seuil garde-fou qui déclenche un retour à l'humain ou une suspension, validé par la conformité avant la mise en production.
  • Si vous évaluez Hermes for Businesses ou un agent concurrent, exigez par écrit l'export du journal d'audit et un mécanisme de gel des versions et des compétences.
  • Croisez votre feuille de route avec le calendrier réglementaire : transparence de l'article 50 de l'AI Act déjà applicable, obligations à haut risque pour la notation de crédit au 2 décembre 2027, et retour d'évaluation de la FCA attendu début 2027 si vous opérez au Royaume-Uni.

Klarna avait des signaux excellents dès le premier mois, et la vérité l'a contredit un an plus tard. HSBC a attendu quatre ans pour publier les siens. Avant de signer le prochain calendrier IA, demandez quelle est la latence de vérité de la métrique et quand la première cohorte sera mûre.

Le parcours complet sur ce secteur :IA dans Fintech.

Questions fréquentes

Qu'est-ce que la latence de vérité d'un projet IA en fintech ?

La latence de vérité est le délai entre une décision prise par l'IA et le moment où l'on sait si elle était bonne. Elle est quasi nulle pour un assistant de rédaction relu immédiatement, mais elle atteint plusieurs mois pour la fraude, où les rétrofacturations arrivent tard, et plus d'un an pour l'octroi de crédit, où les défauts apparaissent progressivement.

Comment fixer une date réaliste pour juger un agent IA de crédit ou de fraude ?

Il faut additionner la mise en production, le temps de constitution d'une cohorte de décisions assez nombreuse et la latence de vérité de la métrique choisie. Dans un exemple hypothétique de pré-instruction de crédit aux TPE, un mois de construction, trois de validation, trois de cohorte et six d'observation des impayés donnent un verdict honnête au bout de treize mois.

Pourquoi Klarna a-t-elle réintroduit des conseillers humains après son assistant IA ?

Klarna avait jugé son assistant sur des métriques de signal : 2,3 millions de conversations le premier mois et un temps de traitement passé de 11 minutes à moins de 2. En mai 2025, son PDG a reconnu que le coût avait trop pesé dans l'évaluation et que la qualité avait baissé, ce qui a conduit l'entreprise à recruter de nouveau des conseillers humains.

Le report de l'AI Act européen change-t-il le calendrier des projets IA de scoring de crédit ?

Oui, en partie. Le Digital Omnibus a repoussé au 2 décembre 2027 les obligations à haut risque de l'annexe III, qui couvrent la notation de crédit. Les obligations de transparence de l'article 50 s'appliquent en revanche depuis le 2 août 2026. Un projet de scoring doit donc déjà respecter les règles de transparence et préparer la gestion des risques, la journalisation et le contrôle humain pour fin 2027.

Pour aller plus loin

Les leçons qui prolongent cet article, en accès libre.

  1. 1Définir des délais et des indicateurs de succès réalistesL'IA dans la fintech
  2. 2Pourquoi la plupart des pilotes IA en fintech ne passent jamais à l'échelleL'IA dans la fintech
  3. 3Construire un modèle de ROI pour une initiative IAL'IA dans la fintech
  4. 4Cadrage, données et critères de succèsConstruire avec l'IA
  5. 5La checklist avant que l'IA ne touche à l'argentL'IA dans la fintech

Sources

Vous avez lu cet article ?

Validez votre lecture pour gagner de l’XP et alimenter votre radar.