+150 XP

La checklist de pré-déploiement qui résiste à un audit

Une actuaire en chef d'un assureur auto particuliers de taille moyenne aux États-Unis doit signer une attestation certifiant qu'un nouveau modèle de souscription fondé sur l'IA est équitable, explicable et sûr à lancer. Elle a trois jours. Le régulateur de l'assurance de l'État a déjà fait savoir qu'il demanderait l'intégralité du dossier modèle si les ratios de sinistralité évoluaient de façon inattendue sur les deux premiers trimestres. Ce n'est pas un cas d'école : c'est à peu près la position dans laquelle se trouvent les actuaires en chef depuis que la NAIC (National Association of Insurance Commissioners) a adopté en 2023 son Model Bulletin on the Use of Artificial Intelligence Systems by Insurers, désormais repris par la plupart des États américains.

Cette leçon parcourt, dans l'ordre, la checklist qu'exige réellement un sign-off défendable.

Pourquoi « ça marche » ne vaut pas sign-off

Un modèle qui prédit bien le ratio de sinistralité peut tout de même échouer sur le plan de la gouvernance. Trois modes de défaillance comptent avant tout en souscription et en tarification :

  • Discrimination par proxy : une variable est corrélée à une classe protégée (race, religion, dans certains États orientation sexuelle) alors même que la classe elle-même est exclue. Les scores d'assurance fondés sur le crédit essuient cette critique depuis des années.
  • Drift silencieux : le modèle a été validé sur des données 2023 ; en 2026, les schémas de sinistres ont changé (inflation des coûts de réparation auto, nouveaux régimes météo pour le dommage aux biens) et le modèle tarife mal le risque sans que personne ne le voie.
  • Responsabilité liée à la boîte noire : si un régulateur ou un assuré demande « pourquoi ai-je été refusé ou surtarifé » et que personne dans l'entreprise ne sait répondre en langage clair, cela suffit à déclencher une action au titre des lois d'État sur les pratiques commerciales déloyales.

La checklist ci-dessous est construite pour combler ces trois écarts avant la mise en production.

Étape 1 : test d'impact disparate

L'impact disparate désigne le cas où une variable neutre en apparence produit des résultats nettement moins favorables pour un groupe protégé, quelle que soit l'intention. C'est le premier test exécuté, car s'il échoue, rien d'autre ne compte encore.

La pratique standard, issue des méthodes du fair lending américain et adaptée par les régulateurs d'État (les règles de test d'algorithmes du SB21-169 du Colorado en sont l'exemple le plus codifié à date de 2025) :

  1. Scorer le modèle sur un jeu de données holdout auquel sont rattachés les attributs démographiques (collectés séparément, jamais injectés dans le modèle lui-même).
  2. Comparer les résultats entre groupes à l'aide d'un adverse impact ratio : le taux d'acceptation ou de tarification favorable du groupe protégé divisé par celui du groupe de référence.
  3. Un seuil fréquemment cité (emprunté à la « four-fifths rule » de l'EEOC américaine en matière d'emploi, reprise de façon informelle dans les tests d'assurance) signale les ratios inférieurs à 0,80 pour examen approfondi. C'est une heuristique de criblage, pas une sécurité juridique.

Exemple chiffré : le modèle accorde une tarification en tranche préférentielle à 60 % d'un groupe démographique et à 42 % d'un autre.

Adverse impact ratio = 42 / 60 = 0,70 → en dessous de la ligne de criblage de 0,80 → déclenche un examen approfondi des variables à l'origine de l'écart.

Les règles du Colorado imposent ce type de test spécifiquement pour les algorithmes d'assurance vie, comme exigence réglementaire effective ; d'autres branches et d'autres États suivent. Voir le centre de ressources de la NAIC sur la gouvernance de l'IA pour l'état des lieux État par État.

Étape 2 : audit des variables proxy

Passer le test d'impact disparate agrégé ne suffit pas. L'actuaire en chef a besoin d'un audit variable par variable :

  • Lancer une analyse de corrélation entre chaque input du modèle et les proxies connus de classes protégées (code postal corrélé à la race ; profession corrélée à la religion dans certaines populations).
  • Tester la sensibilité au retrait : supprimer la variable suspecte, réentraîner, vérifier si l'adverse impact ratio s'améliore sans dégrader sensiblement le pouvoir prédictif (mesuré par coefficient de Gini ou AUC). Si la précision bouge à peine mais que l'équité s'améliore, cette variable est un signal faible porté par un proxy, et elle est en général retirée.
  • Documenter la décision dans un cas comme dans l'autre. Les régulateurs s'intéressent moins au résultat qu'à la preuve que l'analyse a bien eu lieu.

Étape 3 : documentation d'explicabilité

L'explicabilité désigne ici la capacité à énoncer, pour toute décision individuelle, quels facteurs l'ont déterminée et dans quelle proportion.

Deux niveaux sont attendus dans un dossier de gouvernance mature :

  • Explicabilité globale : quelles variables pèsent le plus sur l'ensemble du portefeuille (classements de feature importance, généralement via SHAP, Shapley Additive Explanations).
  • Explicabilité locale : pour un assuré donné, un reason code en langage clair (« prime plus élevée liée principalement à l'indice de coût de réparation du véhicule et à la fréquence de sinistres antérieurs »).

Un extrait minimal de reason code fondé sur SHAP ressemble à ceci :

python
import shap

explainer = shap.TreeExplainer(model)
shap_values = explainer(X_applicant)

# top 3 des facteurs déterminants pour ce demandeur précis
top_features = (
    shap_values[0].values
    .argsort()[-3:][::-1]
)
reason_codes = [feature_names[i] for i in top_features]

Cette sortie alimente directement les adverse action notices, que la plupart des États américains exigent au titre des textes sur les pratiques déloyales en matière de sinistres et de commerce lorsqu'un assuré est refusé, non renouvelé ou tarifé plus cher.

Étape 4 : backtesting du modèle challenger

Avant la mise en production, le modèle en place (production actuelle) et le challenger (nouveau modèle IA) sont exécutés côte à côte sur le même portefeuille historique, en out-of-time.

Points de checklist :

  • Validation out-of-time : tester sur une période que le modèle n'a jamais vue à l'entraînement (par exemple entraînement jusqu'à 2023, test sur les sinistres 2024 à 2025).
  • Stabilité du ratio de sinistralité par segment : vérifier que la performance n'est pas seulement bonne en agrégé mais stable par État, classe de véhicule, tranche d'âge.
  • Pilote live champion-challenger : faire tourner le challenger en shadow mode, en scorant de vraies demandes sans agir sur le score, pendant une fenêtre définie (souvent un cycle de souscription complet, généralement un trimestre) avant la bascule complète.
  • Contrôle du taux d'override : suivre la fréquence à laquelle les souscripteurs passent outre le modèle. Une hausse brutale après déploiement est un signal d'alerte précoce de mauvais calibrage ou de défiance des utilisateurs, deux points à investiguer.

Pour les branches dommages, cette discipline de backtesting reflète ce que décrit l'International Association of Insurance Supervisors (IAIS) dans ses orientations de supervision sur l'IA, et rejoint de plus en plus la classification par l'AI Act européen (règlement (UE) 2024/1689) de certains systèmes de tarification et de souscription d'assurance comme « à haut risque », ce qui impose tests documentés, supervision humaine et surveillance post-market aux assureurs opérant dans l'UE.

Vérification des acquis

1. Pourquoi la checklist exécute-t-elle le test d'impact disparate avant d'autres contrôles comme le suivi du drift ou l'explicabilité ?

2. Un assureur retire la race et la religion de son modèle de souscription mais conserve un score d'assurance fondé sur le crédit. Quel mode de défaillance est le plus directement pertinent à évaluer ici ?

3. Un modèle validé sur des données 2023 est toujours en production en 2026 sans recalibrage, alors que les coûts de réparation et les régimes météo ont sensiblement changé. Quel risque ce scénario illustre-t-il le mieux ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les réponses correctes expliquant pourquoi « le modèle fonctionne » (il prédit bien le ratio de sinistralité) ne suffit pas pour un sign-off de gouvernance.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les réponses correctes concernant l'impact disparate tel que défini dans la leçon.

Sélectionnez toutes les réponses correctes.

Étape 5 : dossier de sign-off de gouvernance

Au moment où l'actuaire en chef doit signer, le dossier doit contenir :

  1. Les résultats du test d'impact disparate avec les adverse impact ratios par classe protégée.
  2. L'audit des variables proxy avec les décisions de maintien/retrait et leur justification.
  3. La documentation d'explicabilité : feature importance globale plus des exemples de reason codes locaux.
  4. Les résultats du backtest challenger, y compris la performance out-of-time et les données du pilote en shadow mode.
  5. Un plan de monitoring : owner nommé, cadence de revue (souvent trimestrielle) et déclencheurs définis de réexamen (par exemple écart du ratio de sinistralité au-delà d'un seuil fixé, ou adverse impact ratio dérivant sous 0,80 après lancement).
  6. La classification du risque modèle selon le framework interne de model risk management de l'entreprise, cohérente avec les orientations SR 11-7 de la Federal Reserve/OCC sur le risque modèle, écrites à l'origine pour les banques mais largement adoptées comme bonne pratique par les équipes model risk en assurance.

Sans le point 5, le sign-off est un instantané, pas de la gouvernance. Les modèles dérivent ; la checklist doit se répéter, pas s'exécuter une seule fois.

🎬 [VIDEO: « How Insurers Are Using AI Responsibly » - youtube.com - chercher les tables rondes de la NAIC ou de la Society of Actuaries sur la gouvernance de l'IA en souscription d'assurance, utiles pour voir régulateurs et actuaires débattre de ces contrôles dans leurs propres mots]

Points clés

  • Le test d'impact disparate passe en premier : calculez les adverse impact ratios par classe protégée avant toute autre évaluation ; un seuil de criblage courant est 0,80, emprunté au droit du travail américain et repris de façon informelle en assurance.
  • Un score agrégé conforme ne suffit pas : auditez chaque variable pour détecter la discrimination par proxy (code postal, profession) à l'aide de tests de sensibilité au retrait.
  • L'explicabilité doit fonctionner à deux niveaux : feature importance globale pour les régulateurs, et reason codes locaux en langage clair pour chaque assuré (souvent exigés pour les adverse action notices).
  • Les modèles challengers exigent un backtesting out-of-time et un pilote en shadow mode avant la bascule ; surveillez les taux d'override comme signal d'alerte précoce après lancement.
  • La gouvernance ne s'arrête pas au sign-off : un plan de monitoring avec owners nommés et déclencheurs de drift est ce qui distingue un vrai framework de risque modèle d'un exercice de conformité ponctuel, en cohérence avec l'orientation du Model Bulletin de la NAIC, des règles de test d'algorithmes du Colorado et des obligations de l'AI Act européen sur les systèmes à haut risque.