Master data et résolution d'identité patient
Maria Gonzalez arrive aux urgences à 2h du matin avec une douleur thoracique. Elle a peur, elle souffre, et donne son nom : « Maria Gonzalez ». L'agent d'accueil, qui va vite, écrit « Marie Gonzales » et saisit son année de naissance 1974 au lieu de 1947. Un nouveau numéro de dossier médical (MRN) est crcrLe pourcentage de visiteurs ou de prospects qui réalisent une action attendue (achat, inscription, formulaire de contact), calculé en divisant les conversions par le nombre total d'opportunités.Voir la définition complète →éé.
Trois heures plus tard, le laboratoire réalise son dosage de troponine. Leur interface n'arrive pas à rapprocher le nom mal orthographié de son dossier existant : elle génère un deuxième enregistrement. Deux semaines après, la facturation envoie un relevé à une ancienne adresse enregistrée sous un troisième dossier.
Une patiente. Trois identités. C'est le quotidien du chaos des identités patient, et c'est l'un des problèmes de données les plus coûteux et les plus dangereux de la santé.
Pourquoi l'identité est le problème de master data
Les master data sont les données de référence centrales dont tout le reste dépend : qui est le patient, qui est le professionnel de santé, quel est l'établissement. Contrairement aux données transactionnelles (un résultat de laboratoire, une demande de remboursement), les master data sont censées être stables et partagées entre les systèmes.
Le Master Data Management (MDM) est la discipline qui consiste à maintenir une version unique et fiable de ces données centrales. À l'hôpital, les deux grands domaines de MDMMDMLe Master Data Management (MDM) est la discipline qui consiste à créer et maintenir une version unique, cohérente et fiable des entités métier centrales d'une organisation : clients, produits, fournisseurs.Voir la définition complète → sont :
- L'identité patient (gérée par un EMPI, défini plus bas)
- L'identité des professionnels de santé (quel médecin, quelle spécialité, quelle entité de facturation)
Quand l'identité casse, la sécurité clinique casse. Un doublon peut masquer une allergie, un diagnostic antérieur ou une liste de médicaments. L'ECRI Institute a régulièrement classé les défauts d'identification des patients parmi les principaux risques liés aux technologies de santé.
Comment un patient devient trois dossiers
Suivez la trace des données de Maria :
- Admission aux urgences : faute de frappe sur le nom et la date de naissance. Nouveau MRN émis.
- Système de laboratoire (LIS) : ne peut pas rapprocher de façon déterministe la faute de frappe du patient existant, crée un dossier fantôme.
- Système de facturation : s'appuie sur un flux démographique obsolète, utilise une adresse périmée, génère une troisième identité.
Techniquement, chaque système a fait son travail. L'échec, c'est qu'aucune couche d'identité partagée ne les a réconciliés. Cette couche, c'est l'EMPI.
L'EMPI : enterprise master patient index
Un EMPI (Enterprise Master Patient Index) est un système qui attribue à chaque personne réelle un identifiant d'entreprise unique et y relie tous ses dossiers sources (urgences, laboratoire, radiologie, facturation). Voyez-le comme le standard téléphonique qui dit : « ces trois MRN, c'est Maria ».
L'EMPI ne supprime pas les dossiers sources. Il les met en correspondance. Maria conserve son MRN des urgences et son numéro de dossier de laboratoire, mais l'EMPI sait qu'ils appartiennent au même identifiant d'entreprise.
Matching : déterministe ou probabiliste
Deux stratégies de matching fondamentales :
Le matching déterministe exige une correspondance exacte sur des champs choisis. Si prénom, nom, date de naissance et sexe correspondent exactement, c'est la même personne. Rapide, mais fragile : « Marie » ne sera jamais égal à « Maria ».
Le matching probabiliste note les correspondances partielles. Il attribue des poids à chaque champ, les additionne et compare le total à un seuil. Cela rattrape les fautes de frappe, les diminutifs et les chiffres inversés.
Voici une illustration simplifiée du scoring (les poids sont indicatifs, ce n'est pas l'algorithme réel d'un éditeur) :
Field Agreement Weight
Last name partial (Levenshtein 1) +4.0
First name partial (Marie/Maria) +3.5
Date of birth digits transposed +2.0
SSN (last 4) exact +8.0
--------------------------------------------------
Total score 17.5
Auto-match threshold : >= 15.0 -> LINK
Manual review band : 8.0 to 14.9
No match : < 8.0Les dossiers qui tombent dans la bande de revue manuelle sont transmis à un data stewarddata stewardUn responsable côté métier, garant de la qualité, de la cohérence et du bon usage des données de son domaine.Voir la définition complète →, une personne formée qui décide de relier ou de laisser séparés. Les EMPI modernes utilisent aussi le matching référentiel : ils comparent les dossiers hospitaliers à une grande base externe d'identités de référence (construite à partir de données de crédit, d'adresses et de registres publics) pour confirmer que « Marie » et « Maria » sont bien une seule personne.
Pour une introduction solide et indépendante des éditeurs, voir HIMSS on patient identity and matching.
Pourquoi il n'existe pas d'identifiant patient national aux États-Unis
Vous vous demandez peut-être : pourquoi ne pas simplement donner un numéro à chacun ? Aux États-Unis, une disposition ancienne de la loi fédérale de finances a bloqué tout financement fédéral pour un identifiant patient unique (UPI). Cette restriction a façonné toute l'industrie : les hôpitaux ont dû construire des EMPI précisément parce qu'il n'existe pas d'identifiant patient délivré par l'État. Le débat se poursuit en 2026, mais à l'heure où ces lignes sont écrites, aucun UPI national n'existe.
Comparez avec certaines parties de l'Europe. Plusieurs pays utilisent des numéros nationaux de santé ou de citoyen (par exemple des systèmes adossés aux identifiants nationaux) qui simplifient considérablement le matching. C'est une vraie différence structurelle : les hôpitaux européens partent souvent d'un ancrage d'identité plus fort, tandis que les hôpitaux américains s'appuient davantage sur la logique probabiliste des EMPI.
Provider MDM : l'autre moitié
Les patients ne sont pas les seules master data. Le provider MDM gère l'identité des cliniciens et des entités de facturation.
Référence clé : le NPI (National Provider Identifier), un numéro à 10 chiffres dont tout professionnel de santé américain a besoin pour facturer, publié dans le registre public NPPES de CMS. Mais le NPI seul ne suffit pas. Un même médecin peut avoir :
- Plusieurs lieux d'exercice
- Plusieurs spécialités
- Différents rattachements à des groupes de facturation
- Un historique de credentialing
Le provider MDM assemble tout cela en un golden record (la version unique faisant autorité). De mauvaises données professionnelles entraînent des rejets de facturation, des réseaux d'adressage cassés et des annuaires « trouver un médecin » inexacts. L'exactitude des annuaires est réglementée : la réglementation fédérale américaine impose aux organismes payeurs de maintenir des annuaires de professionnels exacts, et les inexactitudes sont sanctionnées.
🎬 [VIDEO: "What is an Enterprise Master Patient Index (EMPI)?" - youtube.com - une courte explication montrant comment les EMPI relient les dossiers patients en doublon entre les systèmes]
Les métriques qui mesurent la santé de l'identité
On ne pilote pas ce qu'on ne mesure pas. Voici les principales métriques de qualité des données suivies par les hôpitaux.
Taux de doublons
La métrique phare. C'est la part des dossiers qui sont des doublons d'un patient existant.
$$\text{Taux de doublons} = \frac{\text{Dossiers en doublon}}{\text{Total des dossiers}} \times 100$$
Exemple chiffré : un hôpital compte 900 000 dossiers dans son EMPI. Un audit en signale 63 000 comme doublons.
Taux de doublons = 63 000 / 900 000 = 7 %.
Les commentaires du secteur (par exemple ceux de l'AHIMA, l'American Health Information Management Association) citent depuis longtemps des taux de doublons compris généralement entre 5 % et 10 % au sein d'un même système, et plus élevés lors de fusions de systèmes. À considérer comme des estimations largement reprises, pas comme des chiffres universels audités. Les organisations best-in-class visent des taux de doublons inférieurs à 2 %.
Taux d'overlay
Un overlay est l'inverse dangereux du doublon : deux personnes différentes fusionnées en un seul dossier. Si le dossier de Maria absorbe la liste d'allergies d'un autre patient, c'est un overlay, et c'est un événement de sécurité patient direct. Objectif : le plus proche possible de zéro. Chaque overlay doit déclencher une investigation.
Taux de matching et taux de revue manuelle
- Taux de matching : pourcentage des dossiers entrants que l'EMPI relie automatiquement sans intervention humaine. Plus c'est élevé, mieux c'est, à condition que la précision tienne.
- Taux de revue manuelle : pourcentage qui atterrit dans la file des stewards. Des taux élevés signifient un coût en personnel ; des taux trop bas peuvent masquer des rapprochements manqués.
Vérification des acquis
1. Qu'est-ce qui distingue fondamentalement les master data des données transactionnelles ?
2. Dans le cas de Maria, chaque système a « techniquement fait son travail » et pourtant trois identités ont été créées. Qu'est-ce que cela illustre le mieux à propos de la résolution d'identité ?
3. Pourquoi une identité patient cassée crée-t-elle un risque de sécurité clinique, et pas seulement un problème administratif ?
4. Sélectionnez TOUTES les bonnes réponses expliquant pourquoi le matching déterministe n'a pas réussi à relier les dossiers de Maria.
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les bonnes réponses concernant le Master Data Management (MDM) en milieu hospitalier.
Sélectionnez toutes les réponses correctes.
Gouvernance : qui possède le golden record
Les métriques ont besoin de responsables. La data governancedata governanceLa data governance est l'ensemble des politiques, rôles et processus qui garantissent que les données sont exactes, sécurisées, bien définies et utilisées de façon responsable dans toute l'organisation.Voir la définition complète → est l'ensemble des rôles, politiques et responsabilités relatifs à la qualité des données.
Structure type :
- Les data stewards traitent les files de matching et corrigent les dossiers au quotidien.
- Les data owners (souvent les directeurs HIM) sont responsables du domaine.
- Un comité de gouvernance fixe les seuils (score d'auto-matching, taux de doublons acceptable) et examine les incidents d'overlay.
La gouvernance croise aussi le droit de la vie privée. Aux États-Unis, HIPAA (Health Insurance Portability and Accountability Act) encadre la manière dont les données d'identité patient sont traitées et partagées. En Europe, le RGPD (Règlement général sur la protection des données) classe les données de santé en catégorie particulière exigeant une protection renforcée. Tout matching référentiel contre des bases externes doit respecter ces règles.
Une cadence de gouvernance pratique
- Chaque jour : les stewards vident la file de revue manuelle.
- Chaque semaine : les incidents d'overlay sont examinés par le comité.
- Chaque mois : taux de doublons et taux de matching reportés dans un dashboard.
- À chaque fusion : quand deux hôpitaux fusionnent leurs systèmes, attendez-vous à un pic de doublons et budgétez du temps de steward pour l'absorber.
Récapitulons : maria, résolue
Retour à Maria. Avec un EMPI qui fonctionne :
- Son dossier des urgences avec faute de frappe obtient un score de 17,5 face à son dossier existant. Rapprochement automatique.
- Le dossier de laboratoire est relié au même identifiant d'entreprise, donc les résultats de troponine se rattachent à son historique réel, qui fait apparaître une note cardiologique antérieure.
- La facturation utilise le golden record démographique et envoie le courrier à la bonne adresse.
Une patiente, une identité d'entreprise, trois dossiers sources correctement reliés. Le clinicien voit le tableau complet, et le risque de sécurité disparaît.
Points clés à retenir
- L'identité patient est une master data, et un EMPI est le système qui attribue un identifiant d'entreprise unique et y relie tous les dossiers sources.
- Le matching probabiliste (scoring pondéré avec seuil) l'emporte sur le matching déterministe face aux fautes de frappe et diminutifs du monde réel ; les cas limites vont aux data stewards humains.
- Suivez trois métriques centrales : le taux de doublons (généralement cité entre 5 % et 10 % par système, best-in-class sous 2 %, en tant qu'estimations largement reprises), le taux d'overlay (objectif proche de zéro, événement de sécurité) et les taux de matching / de revue manuelle.
- Les États-Unis n'ont pas d'identifiant patient national, ce qui explique l'importance des EMPI ; de nombreux systèmes européens bénéficient d'identifiants de santé nationaux qui simplifient le matching.
- Le provider MDM bâti sur le registre NPI/NPPES maintient la justesse de la facturation, des adressages et des annuaires, et la gouvernance sous HIPAAHIPAAHealth Insurance Portability and Accountability Act, loi américaine imposant la protection des données de santé (PHI). Violations : amendes jusqu'à 1,9M$ par catégorie de violation. et RGPDRGPDRèglement de l'UE encadrant la collecte, le stockage et l'usage des données personnelles, avec des amendes indexées sur le chiffre d'affaires mondial.Voir la définition complète → définit qui possède et protège le golden record.