Master data et identity resolution : rapprocher HCP, patients et produits
Le Dr Elena Marchetti prescrit un anticoagulant à ses patients à Milan. Dans le registre national des prescripteurs, elle est « MARCHETTI ELENA, Ospedale San Raffaele ». Dans son enregistrement de suivi de prescriptions IQVIA (IQVIA est un fournisseur majeur de données et d'analytics santé), elle apparaît comme « E. Marchetti MD, Cardiology Dept. ». Dans le CRMCRMCustomer Relationship Management : logiciel et stratégie pour gérer et analyser les interactions clients tout au long de leur cycle de vie.Voir la définition complète → du laboratoire (customer relationship management utilisé par les commerciaux), c'est « Elena Marchetti, Key Account, Milan Territory 4 ». Trois enregistrements. Un seul médecin.
Si l'équipe commercial analytics d'un laboratoire ignore qu'il s'agit de la même personne, son volume de prescription est divisé en trois. Elle ressemble à trois médecins à faible valeur au lieu d'une spécialiste à forte valeur. Le ciblage commercial, les actions de formation médicale et le suivi compliance se trompent tous en même temps.
C'est le problème de l'identity resolution, et le résoudre est le rôle du master data managementmaster data managementLe Master Data Management (MDM) est la discipline qui consiste à créer et maintenir une version unique, cohérente et fiable des entités métier centrales d'une organisation : clients, produits, fournisseurs.Voir la définition complète → (MDM) : la discipline qui consiste à crcrLe pourcentage de visiteurs ou de prospects qui réalisent une action attendue (achat, inscription, formulaire de contact), calculé en divisant les conversions par le nombre total d'opportunités.Voir la définition complète →éererLe rapport entre les interactions (likes, commentaires, partages) et le reach d'un contenu, utilisé pour mesurer la réaction de l'audience au regard du nombre de personnes touchées.Voir la définition complète → un enregistrement unique et fiable pour chaque entité du monde réel (un médecin, un hôpital, un médicament) à travers tous les systèmes.
Pourquoi une identité fragmentée casse l'analytics pharma
Chaque laboratoire fonctionne avec des données issues de sources multiples, construites indépendamment :
- CRM interne (Veeva, Salesforce) : comptes rendus de visites des commerciaux, dépôts d'échantillons, notes d'appel.
- Données de claims et de prescription : de fournisseurs comme IQVIA, Symphony Health (groupe ICON) ou, aux États-Unis, des switchs de claims pharmacie comme Surescripts.
- Registres publics : le NPI (National Provider Identifier, identifiant unique à 10 chiffres attribué par l'État américain à tout professionnel de santé agréé) ou, en Europe, les registres des ordres médicaux nationaux, qui varient d'un pays à l'autre et manquent souvent d'un standard d'ID commun.
- Plateformes marketing et affaires médicales : participation à des congrès, paiements de speaker bureau, journaux de demandes d'information médicale.
Aucun de ces systèmes n'a été conçu pour dialoguer avec les autres. Les noms sont mal orthographiés, les hôpitaux fusionnent, les médecins changent d'adresse et les abréviations varient (« St. Mary's Hosp. » vs « Saint Mary Hospital »). Sans couche d'unification, le même prescripteur peut générer cinq à dix « personas » fragmentés dans le patrimoine de données d'une seule entreprise. Le sujet est bien documenté dans les opérations commerciales pharma ; les benchmarks sectoriels de sociétés comme Reltio et Veeva (deux fournisseurs MDM/CRM au service des sciences de la vie) citent régulièrement les doublons d'enregistrements HCP (healthcare professional) parmi les principales plaintes des équipes commercial analytics sur la qualité des données.
Les briques de base : hiérarchies HCP/HCO
Le MDM en pharma ne se limite pas à la déduplication, il s'agit de construire des hiérarchies structurées :
HCP (Health Care Professional) : un individu, comme le Dr Marchetti.
HCO (Health Care Organization) : l'institution pour laquelle elle travaille, l'Ospedale San Raffaele, qui peut elle-même se rattacher à un réseau hospitalier plus large.
Un bon système MDM relie HCP à HCO puis au réseau, pour qu'une entreprise puisse répondre : « Quelle valeur totale représente le réseau San Raffaele ? » et pas seulement « Combien ce médecin a-t-il prescrit ? ». Cela compte commercialement (planification de comptes fiable) et juridiquement : de nombreuses réglementations de transparence et anti-corruption (comme le Sunshine Act américain, issu du Physician Payments Sunshine Act de l'Affordable Care Act, ou la Loi Bertrand / Sunshine française) exigent de déclarer les paiements versés à des professionnels nommés et correctement identifiés. Une erreur d'identification fait courir un risque de non-conformité, pas seulement de mauvaise analyse.
Identifiants courants servant d'ancrage au matching
| Identifiant | Périmètre | Ce qu'il ancre |
|---|---|---|
| NPI | États-Unis uniquement | Professionnel individuel ou organisation |
| Numéros GMC/HPD | Royaume-Uni, variable ailleurs dans l'UE | ID de registre médical national |
| Numéro DEA | États-Unis uniquement | Autorisation de prescrire des substances contrôlées |
| IQVIA OneKey ID | Mondial, fournisseur commercial | Référence master HCP/HCO multi-marchés |
À noter : il n'existe pas d'identifiant HCP mondial unique. C'est la raison d'être des fournisseurs MDM commerciaux (IQVIA OneKey, Veeva Network, Dun & Bradstreet pour les organisations) : ils construisent et licencient des « golden records » référencés de manière croisée, qui rattachent les ID locaux à un ID master unique.
Identité produit : codes NDC et ATC
Le même problème de fragmentation s'applique aux médicaments, et les enjeux y sont sans doute plus élevés puisqu'il affecte la détection des signaux de sécurité, pas seulement l'analytics commercial.
NDC (National Drug Code) : identifiant à 11 chiffres de la FDA américaine, unique à un produit, un dosage et une taille de conditionnement donnés. La même molécule du même fabricant peut avoir plusieurs NDC (tailles de boîte, formulations différentes).
Classification ATC (Anatomical Therapeutic Chemical) : système de l'Organisation mondiale de la santé qui regroupe les médicaments selon le système d'organes sur lequel ils agissent et leurs propriétés thérapeutiques/chimiques (maintenu par le WHO Collaborating Centre for Drug Statistics Methodology). Utilisé mondialement, en particulier en Europe, pour les études épidémiologiques et d'utilisation.
Un exemple concret de l'enjeu : si une équipe de pharmacovigilance (surveillance de la sécurité des médicaments) analyse des déclarations d'effets indésirables et qu'une base enregistre un produit sous son nom de marque, une autre par NDC et une troisième par nom de molécule générique, un signal de sécurité réel peut se diluer entre trois enregistrements produit « différents » au lieu d'émerger comme un schémamaUtiliser un logiciel pour automatiser les tâches et campagnes marketing répétitives, afin de personnaliser à grande échelle sur des canaux comme l'email, le web et le social.Voir la définition complète → unique et clair.
Example: is this the "same" product across systems?
System A (claims): NDC 00069-0420-30 -> "Zithromax 250mg, 30-count"
System B (EHR): "Azithromycin 250 MG Oral Tablet"
System C (WHO ATC): J01FA10 (Azithromycin, anti-infective class)
MDM/product master must resolve all three to one product entity,
while preserving the ability to roll up to molecule (azithromycin)
or therapeutic class (J01FA, macrolides) for epidemiological analysis.Outil de référence gratuit : l'Index ATC/DDD de l'OMS permet de rechercher n'importe quel code ATC et de vérifier la logique de classification, utile pour toute analyse de marché pharma.
Comment fonctionne le matching : déterministe vs probabiliste
Deux techniques de base, souvent combinées :
Matching déterministe : règles de correspondance exacte sur un identifiant fiable. Si deux enregistrements partagent le même NPI, il s'agit de la même entité. Rapide, précis, mais inopérant quand l'identifiant est absent ou incohérent (fréquent hors États-Unis).
Matching probabiliste : scoring de similarité sur plusieurs signaux plus faibles (similarité de nom, proximité d'adresse, spécialité, numéro de téléphone) quand aucun ID fiable unique n'existe. C'est là qu'interviennent les algorithmes de fuzzy matching et, de plus en plus, des classifieurs de machine learning entraînés à produire un score de confiance (« 87 % de probabilité qu'il s'agisse du même HCP ») plutôt qu'un oui/non binaire.
Un pipelinepipelineL'ensemble des opportunités commerciales actives réparties selon les étapes du processus de vente, avec leur valeur potentielle cumulée et leur probabilité de conclusion.Voir la définition complète → MDM pharma pragmatique superpose les deux : tenter d'abord le matching déterministe (peu coûteux, forte confiance), basculer sur le matching probabiliste pour le reste, et router les correspondances à faible confiance vers des data stewards humains pour revue manuelle.
Vérification des acquis
1. Dans l'exemple du Dr Elena Marchetti, quelle est la conséquence business centrale d'un échec à résoudre son identité entre les systèmes ?
2. Quel est l'objectif premier du master data management (MDM) dans le contexte pharma décrit ?
3. Pourquoi l'identity resolution est-elle particulièrement difficile entre les sources de données pharma comme le CRM, les données de claims et les registres publics ?
4. Sélectionnez TOUTES les réponses correctes concernant les sources de fragmentation de l'identité dans l'analytics pharma mentionnées dans la leçon.
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les réponses correctes expliquant pourquoi le même médecin peut apparaître différemment selon les systèmes de données.
Sélectionnez toutes les réponses correctes.
Les métriques de qualité de données qui comptent ici
Parler de « qualité des données » en général est trop vague pour être piloté. Les équipes MDM pharma suivent des métriques précises et auditables :
- Match rate : pourcentage d'enregistrements rattachés avec succès à un golden record. Une cible souvent citée par les fournisseurs MDM se situe au-delà de 90 à 95 % de match rate pour les données HCP centrales, mais il s'agit d'un benchmark de fournisseur, pas d'un standard réglementaire, et les taux réels varient fortement selon la maturité du marché.
- Duplicate rate : pourcentage de « nouveaux » enregistrements créés qui sont en fait des doublons d'entités existantes. Plus bas, mieux c'est ; c'est le symptôme inverse direct du problème du Dr Marchetti.
- Précision de la survivorship : lors de la fusion de doublons, quelles valeurs de champ « gagnent » (adresse la plus récente ? tag de spécialité le plus complet ?). Des règles de survivorship mal gouvernées corrompent silencieusement le golden record.
- Fraîcheur des données / taux de dégradation : les données HCP se dégradent vite. Les professionnels changent d'adresse, d'affiliation et de spécialité. Les commentaires sectoriels des fournisseurs MDM citent souvent qu'une part significative des données de contact HCP devient obsolète en moins d'un an : estimation directionnelle utile, même si les chiffres exacts varient selon les sources et les marchés.
- Complétude du golden record : pourcentage de champs obligatoires (spécialité, affiliation principale, statut de la licence) renseignés et validés.
Ces métriques devraient figurer sur un dashboard de data governancedata governanceLa data governance est l'ensemble des politiques, rôles et processus qui garantissent que les données sont exactes, sécurisées, bien définies et utilisées de façon responsable dans toute l'organisation.Voir la définition complète → revu régulièrement par une fonction de data governance, rattachée le plus souvent à un Chief Data Officer ou équivalent, distincte de l'IT et distincte des opérations commerciales, précisément pour que les incitations d'aucune business unit ne déforment le golden record.
🎬 [VIDEO: « What is Master Data Management? » - youtube.com - cherchez ce titre sur la chaîne IBM Technology pour une présentation neutre et en langage simple des concepts MDM, applicables au-delà de la pharma]
Points clés
- Le master data management résout la fragmentation des identifiants (NPI, IQVIA OneKey ID, ID CRM internes) en un « golden record » unique par HCP, HCO ou produit, ce qui évite une analyse commerciale et de sécurité divisée ou dupliquée.
- Les hiérarchies HCP/HCO comptent à la fois pour la planification de comptes commerciale et pour le reporting compliance (par exemple les déclarations de paiements du Sunshine Act américain), qui exigent d'attribuer correctement les paiements à des individus et institutions nommés.
- Les codes NDC identifient des produits et conditionnements pharmaceutiques américains précis ; les codes ATC classent les médicaments sur le plan thérapeutique à l'échelle mondiale (maintenus par l'OMS). La fragmentation de l'identité produit peut diluer la détection de signal en pharmacovigilance, pas seulement fausser le reporting commercial.
- Le matching combine des méthodes déterministes (correspondance exacte d'ID) et probabilistes (fuzzy, avec score de confiance), plus une revue par des data stewards humains pour les cas à faible confiance.
- Suivez des métriques de qualité de données concrètes (match rate, duplicate rate, précision de la survivorship, fraîcheur des données) sous une data governance indépendante, sans les laisser aux équipes commerciales dont les incitations peuvent privilégier le volume sur l'exactitude.