Le model risk en environnement clinique et en laboratoire
En 2021, des chercheurs qui testaient des dizaines de modèles d'imagerie thoracique COVID-19 ont constaté qu'aucun n'était utilisable en clinique. Beaucoup avaient appris à détecter l'hôpital, pas la maladie : un modèle entraîné là où les patients malades étaient scannés en position allongée avait simplement appris que « allongé = COVID ». Déployé ailleurs, il s'effondrait. C'est le model risk, et en médecine il ne coûte pas seulement de l'argent. Il conduit à des erreurs de diagnostic.
Ce que « model risk » signifie ici
Le model risk est le risque qu'un système d'IA produise des sorties fausses ou nuisibles, et que vous agissiez en conséquence. Dans la banque, les dégâts sont financiers. En biotech et medtech, ce sont une tumeur manquée, une posologie erronée, ou un essai clinique raté qui consume des années de valeur de pipelinepipelineL'ensemble des opportunités commerciales actives réparties selon les étapes du processus de vente, avec leur valeur potentielle cumulée et leur probabilité de conclusion.Voir la définition complète →.
Trois modes de défaillance causent l'essentiel des dégâts réels. Apprenez à les nommer.
1. Le dataset shift
Le dataset shift survient quand les données que voit le modèle en production diffèrent de ses données d'entraînement. Le monde bouge ; le modèle non.
Les variantes que vous rencontrerez :
- Covariate shift : la distribution des entrées change. Un modèle de pathologie entraîné sur des lames provenant d'une marque de scanner voit des lames plus floues issues d'un nouveau scanner, et sa confiance s'effondre.
- Label shift : le mix des issues change. Un prédicteur de sepsis calibré sur une population de patients de 2019 sous-performe quand le case mix évolue après une nouvelle politique d'admission.
- Concept drift : la relation entre entrée et issue change. De nouvelles recommandations thérapeutiques font que les mêmes valeurs biologiques impliquent désormais un risque différent.
L'Epic Sepsis Model est l'avertissement canonique. Une validation externe publiée dans *JAMA Internal Medicine* (2021) a montré qu'il performait bien moins bien que ce que le fournisseur annonçait, manquant la plupart des cas de sepsis au seuil d'alerte utilisé, tout en submergeant les cliniciens d'alertes. Voir le résumé de l'étude sur PubMed.
2. Des cohortes d'entraînement biaisées
Si vos données d'entraînement sous-représentent un groupe, le modèle sous-performe pour ce groupe, silencieusement.
L'exemple le plus cité : les oxymètres de pouls et la couleur de peau. Des études (dont une lettre au *NEJM* de 2020 largement reprise) ont montré que les appareils surestimaient l'oxygénation sanguine chez les patients noirs, masquant des niveaux dangereusement bas. Le schémamaUtiliser un logiciel pour automatiser les tâches et campagnes marketing répétitives, afin de personnaliser à grande échelle sur des canaux comme l'email, le web et le social.Voir la définition complète → se généralise à l'IA : un classifieur dermatologique entraîné majoritairement sur des peaux claires manquera un mélanome sur peau foncée.
Le biais de cohorte frappe aussi le drug discovery. Un modèle entraîné sur des données génomiques orientées vers des cohortes d'ascendance européenne (toujours majoritaires dans les datasets publics en 2026) peut proposer des cibles qui ne se transposent pas d'une population à l'autre, gaspillant les dépenses d'essais en aval.
3. La dégradation silencieuse du modèle
Le cas qui fait peur. Le modèle ne plante pas. Il devient simplement moins bon, et personne ne le remarque parce que les sorties restent plausibles.
Causes : changements dans le pipeline de donnéespipeline de donnéesSéquence automatisée d'étapes qui déplace les données de la source vers la destination : ingestion, transformation, validation et chargement, pour qu'elles arrivent propres et prêtes à l'emploi.Voir la définition complète → en amont (un laboratoire renomme un champ, les unités passent de mg/dL à mmol/L), variations saisonnières de population, une mise à jour firmware sur un instrument. Sans monitoring, la performance peut dériver pendant des mois avant qu'un audit ou un mauvais résultat ne la révèle.
Coter le risque : un framework simple
Les régulateurs attendent que vous catégorisiez et cotiez le risque avant le déploiement, pas après. Utilisez deux axes emprruntés à la gestion du risque clinique (ISO 14971, la norme de gestion des risques des dispositifs médicaux) et appliqués à l'IA.
Score de risque = Gravité x Probabilité x Écart de détectabilité
- Gravité : à quel point une sortie erronée est-elle grave ? (1 = cosmétique, 5 = décès du patient ou échec d'essai)
- Probabilité : quelle est la vraisemblance du mode de défaillance ? (1 = rare, 5 = fréquent)
- Écart de détectabilité : quelle est la probabilité que cela passe inaperçu ? (1 = détecté immédiatement, 5 = totalement silencieux)
Exemple chiffré
Un outil de triage radiologique qui repriorise les worklists.
- Gravité : une hémorragie intracrânienne manquée est catastrophique. Score 5.
- Probabilité : un covariate shift lié à un nouveau scanner CT est plausible dans l'année. Score 3.
- Écart de détectabilité : aucun monitoring de drift en place, les défaillances sont silencieuses. Score 5.
Score de risque = 5 x 3 x 5 = 75 sur un maximum de 125.
Ajoutez maintenant un monitoring de drift avec contrôles de performance hebdomadaires. L'écart de détectabilité tombe à 2.
Nouveau score = 5 x 3 x 2 = 30.
Même modèle, mêmes enjeux cliniques, mais le guardrail a réduit le risque mesuré de 60 pour cent. C'est exactement l'argument que vous présentez à un régulateur ou à un board : le chiffre a bougé grâce à un contrôle précis.
*(Ce schéma de scoring est un outil pédagogique, pas une formule imposée par la réglementation.)*
Ce que les régulateurs exigent réellement
Les noms à connaître pour 2026.
États-Unis, FDA (Food and Drug Administration). Les dispositifs médicaux dotés d'IA sont régulés comme SaMD (Software as a Medical Device). La FDA a autorisé à ce jour plus de 1 000 dispositifs intégrant de l'IA/ML (la liste tenue par la FDA elle-même, mise à jour périodiquement, est la source ; tout décompte ponctuel doit être considéré comme une estimation). L'instrument moderne clé est le Predetermined Change Control Plan (PCCP) : vous déclarez à l'avance comment votre modèle sera mis à jour et surveillé, de sorte qu'un réentraînement n'exige pas une toute nouvelle soumission. La FDA a finalisé la guidance PCCP en décembre 2024.
Europe. Deux couches se superposent :
- Le règlement européen sur les dispositifs médicaux (MDR) et l'IVDR (In Vitro Diagnostic Regulation) encadrent la sécurité et la performance des dispositifs.
- L'AI Act européen (en vigueur depuis 2024, avec une application progressive jusqu'en 2026 et 2027) classe la plupart des IA médicales comme high-risk, ajoutant des exigences de gouvernance des données, de supervision humaine, de logging et de surveillance après commercialisation par-dessus le MDR/IVDR.
À retenir en pratique : en Europe, un produit d'IA médicale doit satisfaire à la fois les règles dispositifs et l'AI Act. Ils se recouvrent mais ne sont pas identiques.
Les guardrailsguardrailsRègles et contrôles qui maintiennent un système d'IA dans des limites sûres, légales et conformes à la marque, en bloquant les sorties et actions hors cadre.Voir la définition complète → à mettre en œuvre avant de déployer
Des contrôles concrets, à peu près dans l'ordre.
Validation externe. Testez sur des données provenant de sites, de scanners et de populations sur lesquels le modèle n'a jamais été entraîné. Si la performance chute nettement, le covariate shift est déjà intégré.
Performance par sous-groupe. Rapportez l'exactitude découpée par âge, sexe, ascendance, couleur de peau, type d'appareil. Une AUC globale unique (Area Under the Curve, mesure d'exactitude d'un classifieur allant de 0,5 à 1,0) masque les défaillances qui blessent des gens.
La calibration, pas seulement l'exactitude. Un modèle peut classer correctement les patients tout en produisant de mauvaises probabilités. Un « risque de 90 pour cent » doit signifier que 90 patients sur 100 de ce type ont effectivement la pathologie.
Monitoring de drift en production. C'est le remède à la dégradation silencieuse. Suivez les distributions d'entrée et de sortie dans le temps et alertez en cas de déviation.
Voici la lentille minimale, avec un test statistique standard pour signaler un covariate shift sur une feature d'entrée :
from scipy.stats import ks_2samp
# reference = valeurs de la feature issues de l'entraînement/validation
# live = même feature sur la dernière fenêtre de production
stat, p_value = ks_2samp(reference_feature, live_feature)
if p_value < 0.01:
alert("Distribution shift detected: investigate before trusting outputs")Le test de Kolmogorov-Smirnov compare deux distributions. Une p-value minuscule signifie que les données live ne ressemblent plus à vos données de référence. C'est votre signal d'alerte précoce, pas un diagnostic.
🎬 [VIDEO: "The Problem with AI in Healthcare" - youtube.com - panorama accessible des défaillances des modèles d'IA médicale sur données réelles et de l'importance de la validation]
Vérification des acquis
1. Un modèle d'imagerie COVID fonctionnait bien dans son hôpital d'origine mais s'est effondré une fois déployé ailleurs, parce qu'il avait appris que les patients scannés en position allongée avaient plus de chances d'avoir le COVID. Qu'est-ce que cette défaillance illustre le plus directement ?
2. Un modèle de pathologie entraîné sur des lames provenant d'une seule marque de scanner voit sa confiance s'effondrer face à des lames plus floues issues d'un scanner récemment installé. Quel type de dataset shift décrit le mieux cette situation ?
3. De nouvelles recommandations cliniques font que le même ensemble de valeurs biologiques implique désormais un niveau de risque différent de celui en vigueur lors de l'entraînement du modèle. Pourquoi est-ce particulièrement dangereux par rapport à un simple changement du mix de patients ?
4. Sélectionnez TOUTES les réponses correctes. Pourquoi le model risk en environnement clinique/laboratoire diffère-t-il du model risk dans la banque ?
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les réponses correctes. Les mauvais résultats de validation externe de l'Epic Sepsis Model servent d'avertissement sur quels concepts ?
Sélectionnez toutes les réponses correctes.
Gouvernance : à qui appartient le risque
Un modèle sans propriétaire est un passif sans adresse. Une gouvernance IA de haut niveau en biotech attribue explicitement trois rôles :
- Model owner (généralement clinique ou R&D) : responsable de l'usage prévu et du retrait du modèle en cas de drift.
- Validation/qualité : contrôle indépendant, fait correspondre les contrôles aux exigences MDR, IVDR, FDA et AI Act.
- MLOps/monitoring : opère les alertes de drift, logue chaque prédiction, tient la piste d'audit exigée par l'AI Act.
Deux autres points non négociables :
Supervision humaine. Un clinicien doit pouvoir voir, questionner et outrepasser le modèle. L'AI Act européen l'impose pour les systèmes high-risk. Le biais d'automatisation (l'humain qui s'en remet à la machine) est lui-même un risque contre lequel il faut concevoir.
Logging et traçabilité. Chaque entrée, sortie, version de modèle et override doit être enregistrée. Quand quelque chose ira mal, et cela arrivera, vous devrez reconstituer ce que le modèle a vu et décidé.
Points clés
- Nommez les trois tueurs : dataset shift (le monde change), cohortes biaisées (les données n'ont jamais été représentatives) et dégradation silencieuse (ça casse sans bruit). La plupart des défaillances post-déploiement relèvent de l'un des trois.
- Cotez le risque avant de livrer, avec gravité x probabilité x écart de détectabilité. Les guardrails se justifient en réduisant l'écart de détectabilité, et vous pouvez montrer le chiffre bouger.
- La réglementation se superpose en Europe : MDR/IVDR plus l'AI Act européen (l'IA médicale est high-risk). Aux États-Unis, la FDA régule l'IA comme SaMD, avec un PCCP qui permet de pré-approuver la façon dont le modèle se met à jour.
- Validez en externe et par sous-groupe. Une AUC globale solide qui masque une mauvaise performance sur peau foncée ou sur un nouveau scanner n'est pas sûre, elle est dangereuse avec un bon marketing.
- Surveillez en production ou volez à l'aveugle. Détection de drift plus logging complet plus un model owner nommé : c'est le minimum crcrLe pourcentage de visiteurs ou de prospects qui réalisent une action attendue (achat, inscription, formulaire de contact), calculé en divisant les conversions par le nombre total d'opportunités.Voir la définition complète →édible de gouvernance pour tout modèle clinique ou de laboratoire déployé.