+150 XP

Construire un workflow de dé-identification et d'évaluation du risque de ré-identification

Un chercheur a publié un jeu de données oncologiques « anonymisé ». Le code postal, la date d'admission et un sous-type tumoral rare y figuraient toujours. En quelques jours, un doctorant l'a croisé avec une nécrologie publique et un communiqué de presse hospitalier, et a nommé un patient. Les noms avaient bien été retirés. Les données n'étaient pas anonymes.

Cette leçon montre comment éviter ce résultat : comment dé-identifier une véritable cohorte oncologique selon les règles américaines et européennes, puis attaquer votre propre jeu de données pour prouver que l'anonymisation tient.

Les deux méthodes américaines à connaître

Sous la loi américaine HIPAA (Health Insurance Portability and Accountability Act, loi fédérale de 1996 encadrant les informations de santé protégées), le HHS (Department of Health and Human Services) reconnaît exactement deux façons de dé-identifier des données. C'est défini dans la Privacy Rule, et le document de référence mérite d'être mis en favori : HHS De-identification Guidance.

Méthode 1 : safe harbor

Supprimer 18 types d'identifiants spécifiés. Exemples pertinents pour un jeu de données oncologiques :

  • Noms
  • Toutes les unités géographiques inférieures à l'État (donc pas de code postal, sauf les 3 premiers chiffres sous certaines règles de population)
  • Tous les éléments de date sauf l'année (pas de date d'admission, pas de date de chirurgie), et les âges au-delà de 89 ans doivent être regroupés dans une catégorie « 90+ »
  • Numéros de dossier médical, identifiants d'appareils, identifiants biométriques
  • Tout autre numéro ou code d'identification unique

Safe Harbor est mécanique. Soit vous avez supprimé les 18 catégories, soit non. Aucun statisticien requis.

Le revers : cela peut détruire la science. La recherche en oncologie a souvent besoin de dates précises (délai entre diagnostic et progression) et d'une géographie fine (analyse des clusters de cancers). Safe Harbor supprime les deux.

Méthode 2 : expert determination

Un statisticien qualifié certifie que le risque de ré-identification est « très faible ». Cela permet de conserver plus de détail (par exemple les intervalles exacts entre événements plutôt que seulement les années) en échange d'une analyse de risque documentée et défendable.

C'est là que se joue le calcul du risque de ré-identification. Et c'est la méthode utilisée par les équipes biotech et medtech sérieuses pour les jeux de données cliniques à forte valeur.

L'Europe est plus stricte, et différente par nature

Sous le RGPD européen (Règlement général sur la protection des données), le standard est plus élevé. Le RGPD distingue :

  • Données pseudonymisées : identifiants remplacés par une clé, mais la reliaison reste possible. Ce sont TOUJOURS des données personnelles et TOUJOURS régulées.
  • Données anonymisées : irréversible, aucun moyen raisonnable de ré-identifier. Elles sortent du champ du RGPD.

La référence réglementaire clé est l'avis du Groupe de travail Article 29 sur les techniques d'anonymisation (ce groupe est aujourd'hui remplacé par l'EDPB, le Comité européen de la protection des données). Le RGPD juge l'anonymisation au regard de trois risques : l'individualisation (singling out), la corrélation (linkability) et l'inférence. Votre workflow doit traiter les trois, pas seulement supprimer les noms.

À retenir en pratique : le Safe Harbor HIPAA n'est PAS automatiquement conforme au RGPD. Un jeu de données légalement publiable à Boston peut rester une donnée personnelle à Berlin.

Le modèle de ré-identification : la k-anonymat

Le k-anonymat est la métrique centrale. Un jeu de données est k-anonyme si chaque enregistrement est indistinguable d'au moins k-1 autres enregistrements, sur la base de ses quasi-identifiants.

Les quasi-identifiants sont des champs qui ne sont pas des identifiants directs mais qui, combinés, permettent d'identifier une personne : âge, sexe, code postal, année d'admission, diagnostic. Une estimation souvent citée (les travaux de Latanya Sweeney, largement repris) suggère qu'environ 87 % de la population américaine était identifiable de façon unique dans les données du recensement de 1990 avec seulement code postal + date de naissance + sexe. À prendre comme une estimation fréquemment citée, pas comme un chiffre actuel, mais la leçon tient : trois champs « inoffensifs » peuvent constituer une empreinte.

Si k=1 pour un enregistrement, cet enregistrement est unique sur ses quasi-identifiants. C'est là votre risque de ré-identification.

Un exemple travaillé

Supposons qu'une cohorte oncologique ait ces quasi-identifiants par patient : `age_band`, `sex`, `state`, `cancer_type`.

Comptez combien de patients partagent chaque combinaison :

age_bandsexstatecancer_typecount (k)
50-59FCABreast42
60-69MNYLung18
40-49FWYOvarian, BRCA11

Les deux premières lignes sont sûres. La troisième a k=1 : une femme quadragénaire dans le Wyoming avec un cas rare de cancer ovarien BRCA1. Même sans son nom, c'est un enregistrement unique. Croisez cela avec un article de presse locale et elle est ré-identifiable.

La correction : généraliser (state devient region, cancer_type devient Ovarian) ou supprimer entièrement la ligne jusqu'à ce que k atteigne votre seuil. Une cible courante est k=5 ou plus pour des données de santé publiées, même si le bon seuil dépend de votre évaluation du risque, pas d'une règle universelle.

Lancer l'attaque en code

Voici un contrôle de k-anonymat minimal. C'est l'étape « audit » : vous attaquez vos propres données avant que quiconque ne le fasse.

python
import pandas as pd

quasi = ["age_band", "sex", "state", "cancer_type"]

# regrouper par quasi-identifiants, compter les enregistrements par combinaison
group_sizes = df.groupby(quasi).size().reset_index(name="k")

# signaler les enregistrements à haut risque où moins de k=5 personnes partagent le profil
risky = group_sizes[group_sizes["k"] < 5]

print(f"Vulnerable equivalence classes: {len(risky)}")
print(f"Patients at risk: {risky['k'].sum()}")
print(risky.sort_values("k").head(10))

Si risky n'est pas vide, vous n'avez pas terminé. Vous généralisez ou supprimez, puis relancez jusqu'à ce que chaque classe atteigne votre seuil.

Au-delà du k-anonymat : deux faiblesses connues

Le k-anonymat seul ne suffit pas. Deux attaques le contournent :

  • Attaque d'homogénéité : un groupe de 5 personnes (k=5) a toutes la MÊME valeur sensible. Si les cinq patients masculins de 60-69 ans avec un cancer du poumon à NY sont tous marqués « décédés dans les 6 mois », vous apprenez l'issue sans avoir besoin d'individualiser qui que ce soit. La correction est la l-diversité (chaque groupe doit contenir au moins *l* valeurs sensibles distinctes).
  • Attaque par connaissance externe : un attaquant sait quelque chose d'extérieur (la date approximative de diagnostic d'un voisin). Le raffinement ici est la t-proximité (t-closeness), qui maintient la distribution de chaque groupe proche de la distribution globale.

Pour la plupart des publications en oncologie, visez le k-anonymat PLUS la l-diversité sur le champ d'issue sensible.

🎬 [VIDEO: "Data Anonymization: k-anonymity, l-diversity and t-closeness explained" - youtube.com - un parcours concis des trois modèles de confidentialité avec exemples travaillés]

Vérification des acquis

1. Dans l'exemple d'ouverture, le jeu de données oncologiques avait été privé des noms, mais un patient a tout de même été identifié en croisant code postal, date d'admission et sous-type tumoral rare. Quel concept central cet échec illustre-t-il ?

2. Une équipe de recherche sur le cancer a besoin de dates précises pour mesurer le délai entre diagnostic et progression, et d'une géographie fine pour l'analyse de clusters. Quelle approche de dé-identification correspond le mieux à ses besoins, et pourquoi ?

3. Pourquoi le Safe Harbor est-il décrit comme « mécanique » par rapport à l'Expert Determination ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les réponses correctes sur la manière dont un jeu de données oncologiques doit être traité pour satisfaire au Safe Harbor HIPAA.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les réponses correctes sur le raisonnement qui justifie de mener une attaque de ré-identification contre votre propre jeu de données dé-identifié.

Sélectionnez toutes les réponses correctes.

L'enveloppe de gouvernance

Les maths ne sont que la moitié du travail. L'autre moitié, c'est la documentation et le processus, parce que les régulateurs et les IRB (Institutional Review Boards, les comités d'éthique qui approuvent la recherche sur sujets humains) vont les demander.

Un workflow défendable comporte ces étapes :

  1. Inventaire des données. Lister chaque champ. Classer chacun comme identifiant direct, quasi-identifiant ou variable clinique non identifiante.
  2. Choix de la méthode. Safe Harbor pour les publications de routine à faible valeur ; Expert Determination pour les jeux de données de recherche nécessitant des dates ou une géographie fines.
  3. Mesure du risque. Lancer les contrôles de k-anonymat et de l-diversité. Consigner les seuils et les résultats.
  4. Transformation. Généraliser, supprimer ou ajouter du bruit contrôlé. Journaliser chaque transformation.
  5. Validation de l'expert. Pour l'Expert Determination, le statisticien documente ses hypothèses et certifie un risque « très faible ». Conservez ce document ; c'est votre piste d'audit.
  6. Data Use Agreement (DUA). Même dé-identifiées, les données sont généralement livrées avec un contrat interdisant les tentatives de ré-identification. Le dispositif Limited Data Set de HIPAA (qui conserve les dates et une partie de la géographie) EXIGE un DUA.
  7. Déclencheur de réévaluation. L'anonymisation se dégrade. De nouveaux jeux de données publics (bases généalogiques, fuites) peuvent réactiver la corrélation plus tard. Planifiez une réévaluation périodique.

Où ça coince dans la réalité

Les données génomiques sont le cas le plus difficile. Un génome est intrinsèquement identifiant : on ne peut pas « dé-identifier » l'ADN comme on masque un code postal, parce que la séquence elle-même est unique. C'est pourquoi des dépôts à accès contrôlé comme dbGaP du NIH existent : les données ne sont pas publiées ouvertement du tout, elles sont réservées à des chercheurs agréés par convention. Quand quelqu'un vous dit que son jeu de données génomiques est « anonymisé », soyez sceptique.

La medtech ajoute la télémétrie des appareils. Un pacemaker ou un capteur de glycémie en continu produit un flux de données dont les motifs temporels peuvent servir d'empreinte comportementale. Traitez les numéros de série des appareils et les horodatages haute résolution comme des quasi-identifiants.

Points clés

  • HIPAA offre deux voies. Safe Harbor (supprimer 18 catégories d'identifiants, pas besoin de statisticien, mais détruit les dates et la géographie fines) ou Expert Determination (analyse de risque documentée, préserve la valeur scientifique).
  • Le RGPD place la barre plus haut. Les données pseudonymisées restent régulées ; une véritable anonymisation doit résister à l'individualisation, à la corrélation et à l'inférence. La conformité Safe Harbor n'équivaut pas à l'anonymisation au sens RGPD.
  • Le k-anonymat est mesurable, donc mesurez-le. Regroupez par quasi-identifiants, signalez toute classe sous votre seuil (k=5 est une cible courante), puis généralisez ou supprimez. Attaquez vos propres données avant publication.
  • Le k-anonymat seul ne suffit pas. Ajoutez la l-diversité pour les issues sensibles et surveillez les attaques d'homogénéité et par connaissance externe.
  • L'anonymisation se dégrade et exige de la gouvernance. Conservez le document d'expert determination, livrez un Data Use Agreement et planifiez une réévaluation, car de nouveaux jeux de données publics peuvent réactiver une corrélation que vous pensiez fermée.

Cette leçon est pédagogique et ne constitue pas un conseil juridique. Consultez un conseil qualifié et un expert statistique certifié avant de publier tout jeu de données au niveau patient.