+150 XP

Master data et identity resolution : rapprocher HCP, patients et produits

Le Dr Elena Marchetti prescrit un anticoagulant à ses patients à Milan. Dans le registre national des prescripteurs, elle est « MARCHETTI ELENA, Ospedale San Raffaele ». Dans son enregistrement de suivi de prescriptions IQVIA (IQVIA est un fournisseur majeur de données et d'analytics santé), elle apparaît comme « E. Marchetti MD, Cardiology Dept. ». Dans le CRM du laboratoire (customer relationship management utilisé par les commerciaux), c'est « Elena Marchetti, Key Account, Milan Territory 4 ». Trois enregistrements. Un seul médecin.

Si l'équipe commercial analytics d'un laboratoire ignore qu'il s'agit de la même personne, son volume de prescription est divisé en trois. Elle ressemble à trois médecins à faible valeur au lieu d'une spécialiste à forte valeur. Le ciblage commercial, les actions de formation médicale et le suivi compliance se trompent tous en même temps.

C'est le problème de l'identity resolution, et le résoudre est le rôle du master data management (MDM) : la discipline qui consiste à créer un enregistrement unique et fiable pour chaque entité du monde réel (un médecin, un hôpital, un médicament) à travers tous les systèmes.

Pourquoi une identité fragmentée casse l'analytics pharma

Chaque laboratoire fonctionne avec des données issues de sources multiples, construites indépendamment :

  • CRM interne (Veeva, Salesforce) : comptes rendus de visites des commerciaux, dépôts d'échantillons, notes d'appel.
  • Données de claims et de prescription : de fournisseurs comme IQVIA, Symphony Health (groupe ICON) ou, aux États-Unis, des switchs de claims pharmacie comme Surescripts.
  • Registres publics : le NPI (National Provider Identifier, identifiant unique à 10 chiffres attribué par l'État américain à tout professionnel de santé agréé) ou, en Europe, les registres des ordres médicaux nationaux, qui varient d'un pays à l'autre et manquent souvent d'un standard d'ID commun.
  • Plateformes marketing et affaires médicales : participation à des congrès, paiements de speaker bureau, journaux de demandes d'information médicale.

Aucun de ces systèmes n'a été conçu pour dialoguer avec les autres. Les noms sont mal orthographiés, les hôpitaux fusionnent, les médecins changent d'adresse et les abréviations varient (« St. Mary's Hosp. » vs « Saint Mary Hospital »). Sans couche d'unification, le même prescripteur peut générer cinq à dix « personas » fragmentés dans le patrimoine de données d'une seule entreprise. Le sujet est bien documenté dans les opérations commerciales pharma ; les benchmarks sectoriels de sociétés comme Reltio et Veeva (deux fournisseurs MDM/CRM au service des sciences de la vie) citent régulièrement les doublons d'enregistrements HCP (healthcare professional) parmi les principales plaintes des équipes commercial analytics sur la qualité des données.

Les briques de base : hiérarchies HCP/HCO

Le MDM en pharma ne se limite pas à la déduplication, il s'agit de construire des hiérarchies structurées :

HCP (Health Care Professional) : un individu, comme le Dr Marchetti.

HCO (Health Care Organization) : l'institution pour laquelle elle travaille, l'Ospedale San Raffaele, qui peut elle-même se rattacher à un réseau hospitalier plus large.

Un bon système MDM relie HCP à HCO puis au réseau, pour qu'une entreprise puisse répondre : « Quelle valeur totale représente le réseau San Raffaele ? » et pas seulement « Combien ce médecin a-t-il prescrit ? ». Cela compte commercialement (planification de comptes fiable) et juridiquement : de nombreuses réglementations de transparence et anti-corruption (comme le Sunshine Act américain, issu du Physician Payments Sunshine Act de l'Affordable Care Act, ou la Loi Bertrand / Sunshine française) exigent de déclarer les paiements versés à des professionnels nommés et correctement identifiés. Une erreur d'identification fait courir un risque de non-conformité, pas seulement de mauvaise analyse.

Identifiants courants servant d'ancrage au matching

IdentifiantPérimètreCe qu'il ancre
NPIÉtats-Unis uniquementProfessionnel individuel ou organisation
Numéros GMC/HPDRoyaume-Uni, variable ailleurs dans l'UEID de registre médical national
Numéro DEAÉtats-Unis uniquementAutorisation de prescrire des substances contrôlées
IQVIA OneKey IDMondial, fournisseur commercialRéférence master HCP/HCO multi-marchés

À noter : il n'existe pas d'identifiant HCP mondial unique. C'est la raison d'être des fournisseurs MDM commerciaux (IQVIA OneKey, Veeva Network, Dun & Bradstreet pour les organisations) : ils construisent et licencient des « golden records » référencés de manière croisée, qui rattachent les ID locaux à un ID master unique.

Identité produit : codes NDC et ATC

Le même problème de fragmentation s'applique aux médicaments, et les enjeux y sont sans doute plus élevés puisqu'il affecte la détection des signaux de sécurité, pas seulement l'analytics commercial.

NDC (National Drug Code) : identifiant à 11 chiffres de la FDA américaine, unique à un produit, un dosage et une taille de conditionnement donnés. La même molécule du même fabricant peut avoir plusieurs NDC (tailles de boîte, formulations différentes).

Classification ATC (Anatomical Therapeutic Chemical) : système de l'Organisation mondiale de la santé qui regroupe les médicaments selon le système d'organes sur lequel ils agissent et leurs propriétés thérapeutiques/chimiques (maintenu par le WHO Collaborating Centre for Drug Statistics Methodology). Utilisé mondialement, en particulier en Europe, pour les études épidémiologiques et d'utilisation.

Un exemple concret de l'enjeu : si une équipe de pharmacovigilance (surveillance de la sécurité des médicaments) analyse des déclarations d'effets indésirables et qu'une base enregistre un produit sous son nom de marque, une autre par NDC et une troisième par nom de molécule générique, un signal de sécurité réel peut se diluer entre trois enregistrements produit « différents » au lieu d'émerger comme un schéma unique et clair.

Example: is this the "same" product across systems?

System A (claims):   NDC 00069-0420-30 -> "Zithromax 250mg, 30-count"
System B (EHR):       "Azithromycin 250 MG Oral Tablet"
System C (WHO ATC):   J01FA10 (Azithromycin, anti-infective class)

MDM/product master must resolve all three to one product entity,
while preserving the ability to roll up to molecule (azithromycin)
or therapeutic class (J01FA, macrolides) for epidemiological analysis.

Outil de référence gratuit : l'Index ATC/DDD de l'OMS permet de rechercher n'importe quel code ATC et de vérifier la logique de classification, utile pour toute analyse de marché pharma.

Comment fonctionne le matching : déterministe vs probabiliste

Deux techniques de base, souvent combinées :

Matching déterministe : règles de correspondance exacte sur un identifiant fiable. Si deux enregistrements partagent le même NPI, il s'agit de la même entité. Rapide, précis, mais inopérant quand l'identifiant est absent ou incohérent (fréquent hors États-Unis).

Matching probabiliste : scoring de similarité sur plusieurs signaux plus faibles (similarité de nom, proximité d'adresse, spécialité, numéro de téléphone) quand aucun ID fiable unique n'existe. C'est là qu'interviennent les algorithmes de fuzzy matching et, de plus en plus, des classifieurs de machine learning entraînés à produire un score de confiance (« 87 % de probabilité qu'il s'agisse du même HCP ») plutôt qu'un oui/non binaire.

Un pipeline MDM pharma pragmatique superpose les deux : tenter d'abord le matching déterministe (peu coûteux, forte confiance), basculer sur le matching probabiliste pour le reste, et router les correspondances à faible confiance vers des data stewards humains pour revue manuelle.

Vérification des acquis

1. Dans l'exemple du Dr Elena Marchetti, quelle est la conséquence business centrale d'un échec à résoudre son identité entre les systèmes ?

2. Quel est l'objectif premier du master data management (MDM) dans le contexte pharma décrit ?

3. Pourquoi l'identity resolution est-elle particulièrement difficile entre les sources de données pharma comme le CRM, les données de claims et les registres publics ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les réponses correctes concernant les sources de fragmentation de l'identité dans l'analytics pharma mentionnées dans la leçon.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les réponses correctes expliquant pourquoi le même médecin peut apparaître différemment selon les systèmes de données.

Sélectionnez toutes les réponses correctes.

Les métriques de qualité de données qui comptent ici

Parler de « qualité des données » en général est trop vague pour être piloté. Les équipes MDM pharma suivent des métriques précises et auditables :

  • Match rate : pourcentage d'enregistrements rattachés avec succès à un golden record. Une cible souvent citée par les fournisseurs MDM se situe au-delà de 90 à 95 % de match rate pour les données HCP centrales, mais il s'agit d'un benchmark de fournisseur, pas d'un standard réglementaire, et les taux réels varient fortement selon la maturité du marché.
  • Duplicate rate : pourcentage de « nouveaux » enregistrements créés qui sont en fait des doublons d'entités existantes. Plus bas, mieux c'est ; c'est le symptôme inverse direct du problème du Dr Marchetti.
  • Précision de la survivorship : lors de la fusion de doublons, quelles valeurs de champ « gagnent » (adresse la plus récente ? tag de spécialité le plus complet ?). Des règles de survivorship mal gouvernées corrompent silencieusement le golden record.
  • Fraîcheur des données / taux de dégradation : les données HCP se dégradent vite. Les professionnels changent d'adresse, d'affiliation et de spécialité. Les commentaires sectoriels des fournisseurs MDM citent souvent qu'une part significative des données de contact HCP devient obsolète en moins d'un an : estimation directionnelle utile, même si les chiffres exacts varient selon les sources et les marchés.
  • Complétude du golden record : pourcentage de champs obligatoires (spécialité, affiliation principale, statut de la licence) renseignés et validés.

Ces métriques devraient figurer sur un dashboard de data governance revu régulièrement par une fonction de data governance, rattachée le plus souvent à un Chief Data Officer ou équivalent, distincte de l'IT et distincte des opérations commerciales, précisément pour que les incitations d'aucune business unit ne déforment le golden record.

🎬 [VIDEO: « What is Master Data Management? » - youtube.com - cherchez ce titre sur la chaîne IBM Technology pour une présentation neutre et en langage simple des concepts MDM, applicables au-delà de la pharma]

Points clés

  • Le master data management résout la fragmentation des identifiants (NPI, IQVIA OneKey ID, ID CRM internes) en un « golden record » unique par HCP, HCO ou produit, ce qui évite une analyse commerciale et de sécurité divisée ou dupliquée.
  • Les hiérarchies HCP/HCO comptent à la fois pour la planification de comptes commerciale et pour le reporting compliance (par exemple les déclarations de paiements du Sunshine Act américain), qui exigent d'attribuer correctement les paiements à des individus et institutions nommés.
  • Les codes NDC identifient des produits et conditionnements pharmaceutiques américains précis ; les codes ATC classent les médicaments sur le plan thérapeutique à l'échelle mondiale (maintenus par l'OMS). La fragmentation de l'identité produit peut diluer la détection de signal en pharmacovigilance, pas seulement fausser le reporting commercial.
  • Le matching combine des méthodes déterministes (correspondance exacte d'ID) et probabilistes (fuzzy, avec score de confiance), plus une revue par des data stewards humains pour les cas à faible confiance.
  • Suivez des métriques de qualité de données concrètes (match rate, duplicate rate, précision de la survivorship, fraîcheur des données) sous une data governance indépendante, sans les laisser aux équipes commerciales dont les incitations peuvent privilégier le volume sur l'exactitude.