Évaluer et mener des proof-of-concepts avec des fournisseurs d'IA
Un fournisseur fait la démonstration d'un outil d'IA qui lit un prospectus de fonds de 200 pages et en extrait les frais de gestion, l'indice de référence et les conditions de rachat en neuf secondes. La salle est impressionnée. Six mois et un contrat signé plus tard, le même outil cale sur le prospectus d'une SICAV luxembourgeoise avec des classes d'actions en notes de bas de page, et votre équipe opérations vérifie de toute façon chaque champ à la main.
La démo était réelle. Le problème, c'est qu'une démo n'est pas un proof-of-concept (POC). Cette leçon vous montre comment concevoir un POC de 90 jours qui vous dit la vérité avant de signer.
Pourquoi l'extraction de documents est le bon cas de test
Les sociétés de gestion croulent sous les documents non structurés : prospectus de fonds, Key Information Documents (KID, les informations normalisées de 3 pages destinées aux investisseurs, exigées par le règlement européen PRIIPs), private placement memoranda, confirmations de transactions et rapports trimestriels des gérants sous-jacents.
L'extraction de documents par IA (recours aux grands modèles de langage et à la reconnaissance optique de caractères pour transformertransformerUn Transformer est une architecture de réseau de neurones qui utilise le self-attention pour traiter des séquences en parallèle. Elle est au cœur de la plupart des modèles de langage et d'IA générative actuels.Voir la définition complète → des PDF en données structurées) est l'une des applications d'IA les plus mûres et les plus rentables du secteur. C'est aussi un candidat idéal pour un POC parce que le succès est mesurable : soit l'outil a extrait les bons frais, soit non.
Le risque, c'est que la précision d'extraction se dégrade fortement sur les documents mal formatés qui constituent votre charge de travail réelle. Un POC existe pour révéler cet écart.
Phase 0 : avant le jour un
Ne lancez pas le chronomètre avant d'avoir verrouillé trois choses.
Définissez le périmètre exact. « Extraire des données des prospectus » est trop vague. Choisissez 8 à 15 champs précis : frais courants, indice de référence, ISIN (International Securities Identification Number), date de lancement, investissement minimum, fréquence de rachat, devise de la classe d'actions. Chaque champ est une cible testable.
Constituez un jeu de documents représentatif. Pas les échantillons propres du fournisseur. Vos documents. Incluez les plus ingrats : fax scannés, prospectus multilingues, fonds avec 12 classes d'actions dans un même tableau. Une erreur courante consiste à tester sur 20 PDF bien rangés alors que la production en enverra 20 000, tous différents.
Mettez-vous d'accord sur la vérité de référence. Il vous faut un « gold set » de documents pour lesquels un humain a déjà consigné la bonne réponse pour chaque champ. Sans cela, vous ne pouvez pas mesurer la précision. Prévoyez de vraies heures d'analystes pour le construire. C'est l'étape la plus souvent sautée, et la raison pour laquelle la plupart des POC produisent des débats plutôt que des preuves.
Phase 1 (jours 1 à 30) : accès aux données et intégration
Le premier mois porte rarement sur la qualité de l'IA. Il porte sur la capacité du fournisseur à accéder à vos données et à restituer des résultats exploitables.
Questions clés :
- Où vont les données ? Si les prospectus contiennent des informations non publiques, le fournisseur les traite-t-il dans votre tenant cloud, ou les envoie-t-il à une APIAPIApplication Programming Interface : une interface standardisée qui permet aux applications de communiquer et d'échanger des données sans connaître leur fonctionnement interne respectif.Voir la définition complète → tierce ? Cela a des implications directes au regard du RGPDRGPDRèglement de l'UE encadrant la collecte, le stockage et l'usage des données personnelles, avec des amendes indexées sur le chiffre d'affaires mondial.Voir la définition complète → (le règlement général européen sur la protection des données) et de votre propre politique de sécurité de l'information.
- Comment les résultats sont-ils livrés ? Un fichier JSON, un endpoint d'API, un tableur ? Cela doit s'intégrer à vos systèmes en aval.
- Quel est le workflow human-in-the-loop ? Quand l'outil n'est pas sûr, comment signale-t-il les extractions à faible confiance pour revue ?
Un bon résultat d'extraction porte un score de confiance par champ, pour que votre équipe ne revoie que les cas incertains :
{
"isin": {"value": "LU0123456789", "confidence": 0.99},
"ongoing_charges_pct": {"value": 1.15, "confidence": 0.62},
"benchmark": {"value": "MSCI World Index", "confidence": 0.88}
}Ici, la confiance de 0,62 sur les frais est la façon dont l'outil vous dit de vérifier ce champ. Un fournisseur dont l'outil ne renvoie aucun score de confiance est un signal d'alerte : il vous oblige à tout revoir ou à faire confiance aveuglément.
Phase 2 (jours 31 à 60) : mesurer la précision qui compte
Passez maintenant l'intégralité du gold set et mesurez. Les deux métriques que l'on confond sans cesse :
- Précision (precision) : parmi les champs que l'outil a remplis, quelle fraction était correcte ?
- Rappel (recall) : parmi les champs qui auraient dû être remplis, quelle fraction l'outil a-t-il trouvée ?
Pour un champ de frais, c'est la précision qui compte le plus : des frais erronés affichés avec assurance sont pires qu'un champ vide, parce qu'un champ vide passe en revue.
Un exemple chiffré
Supposons que votre gold set comporte 1 000 prospectus et que vous testiez le champ « frais courants ».
- L'outil a extrait une valeur pour 950 documents.
- Sur ces 950, il était correct sur 900.
- Les 50 autres documents ont été laissés vides (signalés pour revue humaine).
Précision = 900 / 950 = 94,7 %
Rappel (sur les 1 000) = 900 / 1 000 = 90 %
Vient maintenant la question métier : 94,7 % de précision, est-ce suffisant ? Pour un champ qui alimente une information réglementaire, un taux d'erreur de 5,3 % sur 950 documents représente environ 50 frais erronés diffusés. Probablement inacceptable sans couche de revue. Pour une base de recherche interne, cela peut convenir.
C'est là l'essentiel : il n'existe pas de seuil de précision universel. Le seuil dépend de ce que deviennent ensuite les données extraites.
Comparez à la vraie base de référence
La bonne comparaison n'est pas « IA contre perfection ». C'est « IA plus revue humaine contre votre processus actuel ». Votre processus manuel n'est pas exact à 100 % non plus. Si les analystes se trompent aujourd'hui sur 3 % des champs saisis à la main, un outil à 94,7 % de précision avec revue peut déjà battre le statu quo, sur le coût comme sur la qualité.
Pour un cadre structuré d'évaluation des promesses en machine learning, le Google People + AI Guidebook est une ressource gratuite et non technique sur la façon de fixer les bonnes attentes avec les systèmes d'IA.
Phase 3 (jours 61 à 90) : coût, montée en charge et décision de sortie
Vous savez désormais que l'outil fonctionne sur vos données. Le dernier mois répond à la question de savoir s'il fonctionne à votre volume et à votre prix.
Débit. Si le POC a traité 1 000 documents sans difficulté, que se passe-t-il à 50 000 par trimestre ? Demandez au fournisseur un test de charge.
Modèle de coût. Beaucoup de fournisseurs d'IA facturent au document, à la page ou au tokentokenUn token est l'unité de base de texte que traitent les modèles de langage : le plus souvent un fragment de mot, un mot entier ou un signe de ponctuation, plutôt qu'un simple caractère.Voir la définition complète → (un token équivaut à environ trois quarts de mot pour un LLMLLMUn Large Language Model est un système d'IA entraîné sur d'énormes volumes de texte pour prédire et générer du langage, ce qui permet de rédiger, résumer ou répondre à des questions.Voir la définition complète →). Un prospectus peut faire 100 pages. Faites le calcul réel :
Si le fournisseur facture 0,02 dollar américain par page et que vos prospectus font en moyenne 120 pages, cela fait 2,40 dollars par document. À 50 000 documents par an, cela représente 120 000 dollars par an de traitement seul, avant les frais de licence et votre travail de revue. (Chiffres illustratifs, pas un prix proposé.)
Comparez maintenant au travail économisé. Si un analyste prend 25 minutes par prospectus à la main et que l'outil plus la revue prend 5 minutes, vous économisez 20 minutes sur 50 000 documents, soit environ 16 600 heures. C'est la conversation ROIROIReturn on Investment : le rapport entre le profit net et le coût d'un investissement. Un ROI de 300 % signifie que chaque dollar investi en rapporte 3.Voir la définition complète →, et elle doit inclure votre temps de revue, pas seulement la licence.
Vérification des acquis
1. Pourquoi la leçon soutient-elle qu'une démo fournisseur impressionnante ne constitue pas une preuve suffisante pour signer un contrat ?
2. Pourquoi l'extraction de documents est-elle décrite comme un bon candidat de POC pour les sociétés de gestion ?
3. Quelle est la principale raison pour laquelle la leçon insiste sur l'usage de vos propres documents, y compris « les plus ingrats », plutôt que des échantillons propres du fournisseur dans un POC ?
4. Sélectionnez TOUTES les réponses correctes sur la définition correcte du périmètre en Phase 0 d'un POC.
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les réponses correctes sur les raisons pour lesquelles le prospectus d'une SICAV luxembourgeoise avec des classes d'actions en notes de bas de page pose problème aux outils d'extraction par IA.
Sélectionnez toutes les réponses correctes.
Rédiger les critères de sortie avant de signer
Tout l'intérêt d'un POC de 90 jours est de pouvoir partir. Inscrivez les critères de sortie dans l'accord de POC lui-même, à l'avance, pour que la décision ne soit pas émotionnelle ou politique une fois que tout le monde a investi des efforts.
De bons critères de sortie sont chiffrés et engagés d'avance :
- La précision sur le champ des frais doit atteindre au moins 93 % sur le gold set.
- Le rappel sur l'ensemble des champs cibles doit atteindre au moins 85 %.
- Les scores de confiance doivent être bien calibrés (quand l'outil annonce 0,9, il doit avoir raison environ 90 % du temps).
- Le traitement de bout en bout, revue incluse, doit coûter moins par document que le processus manuel actuel.
- L'intégration avec le système cible doit être démontrée, pas promise.
Si l'outil rate ces seuils, vous ne signez pas. Notez que « la démo était impressionnante » ne figure pas sur la liste.
Signaux d'alerte courants côté fournisseur pendant un POC
- Il résiste aux tests sur vos documents mal formatés et pousse ses échantillons sélectionnés.
- Il ne sait pas expliquer comment le modèle traite un type de document qu'il n'a jamais vu.
- Il communique une précision sans préciser le jeu de test ni la métrique utilisée.
- Le prix n'est indiqué qu'une fois que vous êtes engagé.
- Aucune réponse sur l'endroit où vos données vont physiquement.
Un fournisseur confiant accueille favorablement un POC exigeant. C'est comme cela que les bons outils gagnent.
Points clés
- Une démo, c'est du marketing ; un POC, c'est une preuve. Ne signez jamais sur une démo. Exigez un test structuré et borné dans le temps sur vos propres documents.
- Construisez le gold set d'abord. Sans vérité de référence vérifiée par des humains sur vos documents réels, vous ne pouvez pas mesurer la précision, et chaque désaccord devient une affaire d'opinion.
- Précision et rappel ne sont pas la même chose, et le seuil requis dépend de ce que les données alimentent. Une information réglementaire exige un seuil plus élevé qu'une base interne.
- Comparez l'IA plus revue humaine à votre processus actuel réel, pas à la perfection. Intégrez le travail de revue et le coût de traitement complet dans le ROI, pas seulement les frais de licence.
- Rédigez des critères de sortie chiffrés avant le démarrage du POC. Des seuils engagés d'avance vous permettent de partir sans politique quand l'outil sous-performe.