Cataloguer la taxonomie des risques IA
En 2024, un chatbot d'Air Canada a inventé une politique de remboursement qui n'existait pas, et un tribunal a jugé la compagnie responsable de ce que son IA avait dit. Transposez maintenant à un gestionnaire de fortune dont le copilot LLMLLMUn Large Language Model est un système d'IA entraîné sur d'énormes volumes de texte pour prédire et générer du langage, ce qui permet de rédiger, résumer ou répondre à des questions.Voir la définition complète → annonce à un client qu'un produit structuré est « à capital protégé » alors qu'il ne l'est pas. Même mode de défaillance, enjeux plus élevés, et un régulateur (la SEC ou la FCA) qui observe. Cette leçon transforme une anxiété IA diffuse en un registre de risques concret et scoré, que vous pourriez remettre demain à un Chief Risk Officer.
*LLM = Large Language Model, la technologie derrière les chatbots comme ChatGPT. Copilot = un assistant IA intégré à un workflow, par exemple pour rédiger des emails clients ou résumer de la recherche.*
Pourquoi une taxonomie, et pas une liste d'inquiétudes
Une taxonomie vous oblige à nommer chaque risque, à le localiser dans votre book et à le scorer de façon cohérente. Les régulateurs l'attendent désormais. L'EU AI Act (en vigueur depuis 2024, avec des obligations qui s'échelonnent jusqu'en 2026 et 2027) impose une classification des risques pour les systèmes d'IA. Aux États-Unis, la SEC a poursuivi l'« AI washing » (surévaluer les capacités IA auprès des investisseurs) et le NIST AI Risk Management Framework offre une structure gratuite et neutre vis-à-vis des fournisseurs, que beaucoup de firmes américaines adoptent volontairement.
*Book = le portefeuille et la base clients gérés par une firme. Un book « live » signifie de l'argent client réel, pas un sandbox.*
Nous allons scorer chaque risque sur deux axes, de 1 à 5 :
- Probabilité : à quelle fréquence cela pourrait plausiblement se produire.
- Impact : préjudice client, exposition réglementaire et perte financière combinés.
Score de risque = Probabilité x Impact. Tout score égal ou supérieur à 15 exige un owner nommé et une mesure de mitigation avant déploiement.
Les quatre risques majeurs
1. Les copilots LLM qui hallucinent
Une hallucinationhallucinationUne hallucination, c'est lorsqu'un modèle d'IA produit une réponse fluide et assurée mais factuellement fausse, inventée, ou non étayée par ses données sources.Voir la définition complète →, c'est quand un LLM produit un texte fluide et assuré mais factuellement faux. En asset management, cela apparaît dans le chat client, la rédaction de RFP (Request For Proposal) et le résumé de recherche.
Scène concrète : une banque privée déploie un copilot pour résumer les fiches de fonds. Il indique des frais courants de 0,45 % alors que le chiffre réel est 0,95 %. Un relationship manager copie cela dans un email client. C'est une exposition au mis-selling au titre de MiFID II (la directive européenne sur les marchés d'instruments financiers, qui encadre l'adéquation et l'information).
- Probabilité : 4 (l'hallucination est inhérente aux LLM actuels)
- Impact : 4 (préjudice client direct, manquement réglementaire)
- Score : 16
Garde-fou : retrieval-augmented generationretrieval-augmented generationMéthode qui permet à un modèle d'IA de répondre à partir de vos propres documents, en récupérant les passages pertinents avant de générer une réponse.Voir la définition complète → (RAG), où le modèle doit citer un document source, plus une règle selon laquelle tout chiffre cité doit renvoyer à la ligne source. Ne laissez jamais un copilot générer librement des chiffres.
2. Le herding corrélé des modèles
C'est le risque discret, systémique. Si de nombreux gérants licencient le même modèle de fondation ou le même fournisseur de signaux, leurs portefeuilles peuvent commencer à réagir aux mêmes prompts de la même manière. Quand l'IA de tout le monde dit « réduire la duration » au même moment, vous obtenez des crowded trades et des trous de liquidité.
La Bank of England et le Financial Stability Board ont tous deux signalé ce risque de concentration. Ce n'est pas théorique : les stratégies quant ont déjà montré des phénomènes de crowding (le « quant quake » d'août 2007 est l'exemple classique pré-IA).
- Probabilité : 3 (en hausse à mesure que l'adoption se concentre)
- Impact : 5 (systémique, touche tout le book en marchés stressés)
- Score : 15
Garde-fou : suivez la diversité des fournisseurs et des modèles comme une métrique surveillée. Stress testez le book en supposant qu'un signal corrélé piloté par l'IA se déclenche simultanément chez vos pairs.
3. La fuite de données
Deux variantes. D'abord, **des données confidentielles (PII clients, positions, informations de deal) qui fuient *vers* un modèle public quand des collaborateurs les collent dans un chatbot grand public**. Ensuite, des outputs de modèle qui divulguent des informations qu'ils ne devraient pas, par exemple un copilot entraîné sur le mandat d'un client qui fait remonter des détails à un autre.
*PII = Personally Identifiable Information, protégées par le RGPD en Europe et diverses lois d'État aux États-Unis.*
Scène concrète : un analyste colle une position M&A pré-annonce dans un LLM public pour « aider à rédiger le mémo ». Ces données peuvent désormais résider sur un serveur tiers. Au titre du RGPD, les amendes peuvent atteindre 4 % du chiffre d'affaires annuel mondial. Au titre des règles sur l'abus de marché (le Market Abuse Regulation européen, MAR), la position elle-même constitue une information privilégiée.
- Probabilité : 4 (le comportement humain est le maillon faible)
- Impact : 5 (réglementaire, réputationnel, potentiellement pénal)
- Score : 20
Garde-fou : bloquez les outils IA grand public sur les appareils de l'entreprise, fournissez une instance entreprise avec protection contractuelle des données (pas d'entraînement sur vos données) et loguez chaque prompt.
4. La concentration fournisseurs
La plupart des firmes ne construisent pas de modèles de fondation. Elles les louent à une poignée de fournisseurs (OpenAI, Anthropic, Google, Microsoft, plus les hébergeurs cloud AWS et Azure). Si un fournisseur change ses prix, déprécie une version de modèle ou subit une panne, votre workflow casse.
Scène concrète : une version de modèle dont dépend votre workflow de compliance est retirée avec 90 jours de préavis, et le remplacement se comporte différemment sur vos prompts. Vous devez tout revalider.
- Probabilité : 3
- Impact : 4 (opérationnel, pas immédiatement visible du client)
- Score : 12
Garde-fou : abstraction multi-fournisseurs (routez les prompts via une couche capable de changer de provider) et préavis contractuels. C'est de la résilience opérationnelle classique, désormais couverte en Europe par DORA (le Digital Operational Resilience Act, applicable aux entités financières depuis janvier 2025), qui inclut explicitement les tiers ICT critiques.
Le registre de risques, assemblé
| Risque | Probabilité | Impact | Score | Owner |
|---|---|---|---|---|
| Fuite de données | 4 | 5 | 20 | CISO |
| Copilot qui hallucine | 4 | 4 | 16 | Head of Advice |
| Herding de modèles | 3 | 5 | 15 | CIO |
| Concentration fournisseurs | 3 | 4 | 12 | COO |
Tout ce qui est à 15 ou au-dessus (trois sur quatre) exige une mitigation avant la mise en production. La fuite de données arrive en tête non pas parce qu'elle est exotique mais parce que le comportement humain fait monter la probabilité.
🎬 [VIDEO: "The Air Canada Chatbot Case" - youtube.com - une courte explication de la décision du tribunal tenant une entreprise responsable des fausses déclarations de son IA, directement pertinente pour la responsabilité liée aux copilots]
Le scoring en code
Si vous tenez ce registre dans un tableur ou un pipeline de donnéespipeline de donnéesSéquence automatisée d'étapes qui déplace les données de la source vers la destination : ingestion, transformation, validation et chargement, pour qu'elles arrivent propres et prêtes à l'emploi.Voir la définition complète →, la logique est triviale et mérite d'être automatisée pour que les scores se mettent à jour quand vos estimations changent :
risks = [
{"name": "Data leakage", "likelihood": 4, "impact": 5},
{"name": "Hallucinating copilot","likelihood": 4, "impact": 4},
{"name": "Model herding", "likelihood": 3, "impact": 5},
{"name": "Vendor concentration","likelihood": 3, "impact": 4},
]
THRESHOLD = 15
for r in risks:
r["score"] = r["likelihood"] * r["impact"]
r["action"] = "MITIGATE PRE-DEPLOY" if r["score"] >= THRESHOLD else "monitor"
for r in sorted(risks, key=lambda x: -x["score"]):
print(f'{r["name"]:24} {r["score"]:>2} {r["action"]}')L'important n'est pas le code. C'est que le seuil soit explicite, auditable et cohérent pour chaque cas d'usage IA que vous examinez.
Vérification des acquis
1. Pourquoi la leçon recommande-t-elle de construire une taxonomie scorée plutôt qu'une « liste d'inquiétudes » informelle sur les risques IA ?
2. Un risque est scoré Probabilité 4 et Impact 4. Qu'exige la méthodologie de la leçon avant déploiement ?
3. Le cas du chatbot d'Air Canada illustre quel principe général pertinent pour les gestionnaires de fortune ?
4. Sélectionnez TOUTES les réponses correctes sur la façon dont la leçon définit l'axe Impact du score de risque.
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les réponses correctes sur les hallucinations des copilots LLM telles que décrites dans la leçon.
Sélectionnez toutes les réponses correctes.
Du registre aux garde-fousgarde-fousRègles et contrôles qui maintiennent un système d'IA dans des limites sûres, légales et conformes à la marque, en bloquant les sorties et actions hors cadre.Voir la définition complète →
Un score est un diagnostic. Le garde-fou est le traitement. Faites correspondre chaque risque à score élevé à un contrôle que vous exécutez *avant* le déploiement et à un contrôle que vous exécutez *en continu* ensuite.
Contrôles avant déploiement
- Validation du modèle : testez le copilot sur un jeu fixe de questions à réponse connue. Mesurez le taux d'hallucination. S'il invente des chiffres plus qu'une fraction infime du temps, il ne va pas au contact du client.
- Red teaming : essayez délibérément de faire fuiter des données au modèle ou de le faire dire quelque chose de non conforme. Documentez ce qui casse.
- Human in the loop : pour tout output qui atteint un client ou déclenche une transaction, définissez qui valide. L'EU AI Act impose une supervision humaine pour les systèmes à risque plus élevé.
Contrôles continus
- Logging des prompts et des outputs : conservez une piste auditable. Quand un régulateur demande « qu'est-ce que votre IA a dit à ce client », vous devez répondre.
- Monitoring de la dérive : le comportement du modèle change quand le fournisseur le met à jour. Relancez vos tests à réponse connue à intervalles réguliers.
- Dashboard de concentration : suivez la part de votre workflow qui dépend d'un seul modèle ou fournisseur.
À qui cela appartient
La gouvernance n'est pas « le problème de l'équipe IA ». Le risque modèle relève du CROCROLe Conversion Rate Optimization (CRO) est la pratique systématique visant à augmenter le pourcentage d'utilisateurs qui réalisent une action souhaitée, en s'appuyant sur la data, les tests et la recherche utilisateur.Voir la définition complète → et du CIO, la fuite de données du CISO, la résilience fournisseurs du COO, et l'exactitude au contact du client du head of advice. Le conseil signe l'appétit au risque. Cela reprend le modèle des « trois lignes de défense » que les professionnels du risque utilisent déjà : le business porte le risque, le risque et la compliance le challengent, et l'audit interne vérifie l'ensemble.
À retenir
- Scorez, ne ressentez pas. Probabilité x Impact, avec un seuil publié (nous avons utilisé 15), transforme l'anxiété IA en un registre auditable avec des owners nommés.
- La fuite de données arrive généralement en tête parce que le comportement humain fait monter la probabilité. Bloquez les outils IA grand public, fournissez une instance entreprise protégée contractuellement, et loguez tout.
- Ne laissez jamais un copilot inventer des chiffres. Utilisez du retrieval avec citation obligatoire de la source, et gardez une validation humaine sur tout ce qui touche le client ou déclenche une transaction.
- Le herding de modèles est le risque systémique dormant. Surveillez la diversité des fournisseurs et des modèles, et stress testez le scénario où l'IA de chaque pair déclenche le même signal au même moment.
- La réglementation est réelle et nommée. EU AI Act, RGPDRGPDRèglement de l'UE encadrant la collecte, le stockage et l'usage des données personnelles, avec des amendes indexées sur le chiffre d'affaires mondial.Voir la définition complète →, MiFID II, MAR et DORA en Europe ; la SEC et le NIST AI RMF aux États-Unis. Rattachez chaque garde-fou à la règle qu'il satisfait.