Quatre identifiants, zéro cohérence : pourquoi l'HCP matching reste le problème non résolu de la data pharma
Dans les systèmes de données pharmaceutiques, un même médecin peut apparaître sous des dizaines d'identifiants différents selon la source, le pays ou le canal promotionnel. Résoudre ce problème d'identité n'est pas une question technique accessoire : c'est la condition pour que la conformité, la pharmacovigilance et la stratégie commerciale reposent sur des faits plutôt que sur du bruit.
Claude VectorResponsable data et analytics24 septembre 2026Un cardiologue prescrit du Xarelto dans trois hôpitaux différents, reçoit des visites de délégués médicaux sous deux formes de son nom, figure dans le CRMCRMCustomer Relationship Management : logiciel et stratégie pour gérer et analyser les interactions clients tout au long de leur cycle de vie.Voir la définition complète → de Bayer avec un identifiant, dans IQVIA OneKey avec un autre, et dans le système de pharmacovigilance avec un troisième. Ces quatre enregistrements décrivent la même personne. Les systèmes, eux, ne le savent pas.
C'est le problème central de l'identity resolution en pharma : la multiplication des identifiants pour une même entité, qu'il s'agisse d'un professionnel de santé (HCP), d'un patient ou d'un produit. Le concept n'est pas nouveau, mais les conséquences de son échec sont devenues trop coûteuses pour être ignorées.
Pourquoi l'identity resolution pèse-t-elle plus lourd en pharma ?
Dans d'autres industries, une mauvaise résolution d'identité produit surtout des campagnes marketing inefficaces. En pharma, les enjeux se déplacent vers la conformité réglementaire et la sécurité des patients.
Prenons le cas des HCP d'abord. La loi américaine Sunshine Act impose aux fabricants de médicaments de déclarer chaque transfert de valeur vers un médecin, qu'il s'agisse d'un repas à 25 dollars ou d'une conférence à 5 000 dollars. Si Pfizer ou Novartis ne parvient pas à consolider les identités de ses HCP en amont de ce reporting, les montants déclarés par HCP sont faux. L'Open Payments Database, administrée par CMS, publie ces données publiquement. Une erreur d'imputation crcrLe pourcentage de visiteurs ou de prospects qui réalisent une action attendue (achat, inscription, formulaire de contact), calculé en divisant les conversions par le nombre total d'opportunités.Voir la définition complète →ée un risque juridique direct et une exposition médiatique.
Pour les patients, les enjeux basculent vers la pharmacovigilance. Le système de déclaration des effets indésirables repose sur la capacité à relier un événement à un patient sans créererLe rapport entre les interactions (likes, commentaires, partages) et le reach d'un contenu, utilisé pour mesurer la réaction de l'audience au regard du nombre de personnes touchées.Voir la définition complète → de doublons. Un même patient déclarant deux fois le même effet indésirable sous des identités légèrement différentes peut faire gonfler artificiellement les signaux de sécurité, ou à l'inverse les diluer. Les autorités comme la FDA et l'EMA attendent une intégrité des données de sécurité qui ne peut exister sans résolution d'identité propre.
Pour les produits, le problème prend une autre forme. Un médicament commercialisé sous plusieurs noms selon les marchés (Tylenol aux États-Unis, Panadol en Europe, Doliprane en France), avec des dosages, des formes galéniques et des codes NDC distincts, doit être tracé à travers toute la chaîne de distribution pour les obligations de reporting de prix, notamment dans le cadre du Medicaid Drug Rebate Program.
Normalisation, matching probabiliste et golden record HCP
La résolution d'identité consiste à décider si deux enregistrements distincts décrivent la même entité réelle. En pratique, les équipes data pharma travaillent sur trois niveaux successifs.
Le premier est la normalisation. Avant de comparer, il faut standardiser : transcription du nom (Dr. Jean-Marc Dupont / J.-M. Dupont / Dupont JM), format d'adresse, spécialité médicale selon la terminologie SNOMED ou MedDRA. Sans cette étape, le taux de faux négatifs explose.
Le deuxième est le matching probabiliste. On calcule un score de similarité entre paires d'enregistrements en pondérant plusieurs attributs : nom, NPI (National Provider Identifier aux États-Unis), numéro RPPS en France, adresse d'exercice, spécialité. Un seuil déclenche soit la fusion automatique, soit une file de révision manuelle. Des outils comme Veeva Network ou IQVIA OneKey embarquent cette logique avec des référentiels HCP préconstruits. Il faut noter qu'IQVIA commercialise ces solutions, les performances annoncées méritent d'être confrontées à des audits internes avant d'être intégrées dans un contrat de service.
Le troisième est la gouvernance du golden record. Une fois les identités fusionnées, le système doit désigner une version faisant autorité, le golden record, et propager cette identité résolue vers les systèmes en aval : CRM Veeva, ERPERPUn système intégré unique qui gère les opérations clés : finance, achats, supply chain, RH et production sur des données partagées.Voir la définition complète → SAP, entrepôt de pharmacovigilance. C'est ici queles décisions d'architecture MDMMDMLe Master Data Management (MDM) est la discipline qui consiste à créer et maintenir une version unique, cohérente et fiable des entités métier centrales d'une organisation : clients, produits, fournisseurs.Voir la définition complète → deviennent critiques : un style de MDM en "registry" maintient le lien entre les sources sans les modifier, tandis qu'un style en "consolidation" crée une copie mamaUtiliser un logiciel pour automatiser les tâches et campagnes marketing répétitives, afin de personnaliser à grande échelle sur des canaux comme l'email, le web et le social.Voir la définition complète →îtresse centralisée.
Prenons un exemple concret. Sanofi souhaite mesurer le taux de couverturecouvertureLe nombre de personnes uniques exposées à votre message sur une période donnée. Contrairement aux impressions, le reach compte chaque personne une seule fois, quel que soit le nombre d'expositions.Voir la définition complète → de ses délégués médicaux sur les oncologues prescrivant du Dupixent. Si le CRM contient 1 200 enregistrements HCP pour cette spécialité mais que 180 sont des doublons non résolus, le ratio de couverture calculé est faux. La direction commerciale prend des décisions de redéploiement de force de vente sur des chiffres erronés.
Où le matching automatique échoue sur les HCP multi-pays
L'automatisation du matching fonctionne bien dans deux cas : quand les sources partagent un identifiant commun fiable (le NPI aux États-Unis est une référence solide pour les HCP, à condition qu'il soit renseigné) et quand le volume de données est suffisant pour entraîner un modèle de scoring correctement calibré.
Elle atteint ses limites dans plusieurs situations propres à la pharma.
Les HCP exerçant dans plusieurs pays posent un problème structurel. Un médecin consultant en Allemagne et au Royaume-Uni n'a pas d'identifiant transfrontalier standardisé. Les référentiels nationaux (HPC en Allemagne, GMC au Royaume-Uni) ne communiquent pas entre eux. L'harmonisation demande un travail manuel et une gouvernance internationale que peu d'entreprises ont mise en place.
Les patients posent un problème différent : la réglementation interdit souvent d'utiliser les attributs les plus discriminants. En Europe, le RGPDRGPDRèglement de l'UE encadrant la collecte, le stockage et l'usage des données personnelles, avec des amendes indexées sur le chiffre d'affaires mondial.Voir la définition complète → limite l'utilisation des données de santé comme facteur de matching, etles frontières du consentement conditionneront ce que vos algorithmes peuvent effectivement utiliser. L'anonymisation dégradant la précision du matching, les taux de résolution chutent précisément là où la rigueur serait la plus nécessaire.
Les produits multi-marchés souffrent d'un problème de nomenclature. Le code NDC américain, le code EAN européen et le code CIP français décrivent parfois le même SKU, parfois des variantes distinctes. Cartographier ces équivalences sans créer de faux positifs demande une connaissance métier que les algorithmes seuls ne possèdent pas.
La tentation est de résoudre ces problèmes uniquement avec de la technologie. Les vendors de MDM et de data qualitydata qualityLe degré d'aptitude des données à l'usage prévu : exactes, complètes, cohérentes, à jour, valides et uniques. Une data quality faible fragilise l'analytics, le reporting et l'IA.Voir la définition complète → vendent des plateformes capables d'
Le parcours complet sur ce secteur :Data dans Industrie pharmaceutique.
Questions fréquentes
Quels identifiants utiliser pour rapprocher les fiches HCP ?
Le NPI aux États-Unis et le RPPS en France sont les ancres les plus fiables pour rapprocher les fiches HCP, à condition qu'ils soient renseignés. Le matching probabiliste les pondère avec le nom, l'adresse d'exercice et la spécialité, puis un seuil déclenche soit la fusion automatique, soit une file de révision manuelle.
Quel est le risque du Sunshine Act en cas de doublons HCP ?
Des identités HCP non consolidées faussent les montants déclarés par médecin au titre du Sunshine Act. Comme l'Open Payments Database administrée par CMS publie ces données, une erreur d'imputation crée un risque juridique direct et une exposition médiatique pour le fabricant.
Le RGPD empêche-t-il le matching des patients en Europe ?
Le RGPD ne l'interdit pas mais limite l'usage des données de santé comme facteur de matching, donc prive les algorithmes des attributs les plus discriminants. Les frontières du consentement déterminent ce qui reste utilisable, et l'anonymisation dégrade la précision : les taux de résolution chutent là où la pharmacovigilance exigerait le plus de rigueur.
Faut-il choisir un MDM en registry ou en consolidation ?
Le style registry maintient les liens entre les sources sans les modifier, le style consolidation crée une copie maîtresse centralisée. Le choix conditionne la façon dont le golden record est propagé vers les systèmes en aval : CRM Veeva, ERP SAP, entrepôt de pharmacovigilance.
Pour aller plus loin
Les leçons qui prolongent cet article, en accès libre.
- 1Le Master Data Management en pratique : styles, outils et Golden RecordData governance & compliance
- 2Les métriques de qualité de données qui comptent : complétude, latence et lineageLa data dans le pharma
- 3Cartographier le paysage des données pharma : sources, fournisseurs et standardsLa data dans le pharma
- 4Consentement, dé-identification et limites des données anonymesLa data dans le pharma
- 5Le marketing en laisse : compliance promotionnelle et champ de mines anti-kickbackPharma : comment fonctionne le secteur
Sources
- Fivetran + dbt Labs Announces New Capabilities to Make Enterprise Data Agent-Ready at dbt Summit 2026
- Everything we announced at dbt Summit and why it matters
- We built dbt State to stop rebuilding what hadn't changed
- Celebrating the 2026 dbt partner of the year winners
- Spot New Tech Skills Emerging From the Workforce
- Building on AI’s Unfinished Foundation
- Databricks processes your data. dbt defines what it means
- dbt Core v1.12 is GA
- Model for the token, not the table
- How dbt State cuts warehouse compute and speeds up every run
- dbt Summit 2026: the keynotes and product sessions
- Retiring the dbt Snowflake Native App
- Fivetran + dbt Labs: The future of dbt Core v2.0
- Your next level starts here: A preview of dbt Summit sessions, by role
Vous avez lu cet article ?
Validez votre lecture pour gagner de l’XP et alimenter votre radar.