Ein HCP, sechs Datensätze: warum Identity Resolution das teuerste Datenproblem der Pharmabranche ist

Ein einzelner Kardiologe kann in CRM, Claims-Daten und Prescriber-Analytics eines Pharmaunternehmens als sechs verschiedene Entitäten existieren, und keine davon passt zur anderen. Solange Identity Resolution in der Praxis nicht funktioniert, steht jede nachgelagerte Entscheidung, von der Sampling-Allokation bis zum Pharmakovigilanz-Reporting, auf einem brüchigen Fundament.

Identity Resolution in Pharma-Datensystemen bezeichnet den Prozess, festzustellen, dass zwei oder mehr Datensätze aus getrennten Datenquellen dieselbe reale Entität meinen: einen bestimmten Healthcare Professional, einen Patienten oder ein Produkt. Das Konzept klingt einfach. Die Umsetzung ist es nicht, und die Folgen eines Fehlschlags reichen von verschwendetem Commercial Spend bis zum Regelverstoß.

Identitätsdomänen für HCP, Patienten und Produkte in Pharma

Die Pharmaindustrie pflegt drei getrennte Identitätsdomänen parallel, und jede bringt eigene Risiken mit.

Bei Healthcare Professionals sind die kommerziellen Folgen unmittelbar. Ein Medical Science Liaison, der „Dr. Sarah Chen“ am Brigham and Women's Hospital besucht, sollte auf dasselbe Profil zugreifen wie der CRM-Datensatz aus Veeva, die von IQVIA gekauften Prescriber-Daten, der Speaker-Bureau-Eintrag eines externen Compliance-Anbieters und der an die FDA übermittelte Adverse-Event-Report. Lösen sich diese Datensätze nicht auf eine Entität auf, bewirbt das Unternehmen dieselbe Ärztin womöglich über drei Kanäle zu intensiv (ein Anti-Kickback-Risiko), sampelt eine Prescriberin einer hohen Dezile zu wenig, weil ihre Datensätze auf zwei Territories verteilt sind, oder übersieht im Pharmakovigilanz-Kontext ein Sicherheitssignal, weil doppelte Meldungen als getrennte Fälle behandelt werden.

Bei Patienten verschieben sich die Risiken gleichzeitig Richtung Sicherheit und Datenschutz. Longitudinale Patientendaten aus Abgabedaten von Spezialapotheken, HEOR-Datensätzen wie IQVIA Real World Solutions oder Claims-Daten von Optum und Touchpoints aus Patient-Support-Programmen liefern nur dann belastbare Outcomes-Evidenz, wenn die Datensätze desselben Patienten über die Zeit verknüpft sind. Fragmentierte Identität bedeutet fragmentierte Therapieverläufe, und das verfälscht sowohl Real-World-Evidence-Studien für Regulierungsbehörden als auch die interne Analytik, die das Design von Patient-Support-Programmen steuert. Eine Fehlidentifikation in einem Pharmakovigilanz-Report kann dazu führen, dass ein doppelt erfasstes Adverse Event das Sicherheitssignal eines Medikaments aufbläht. Umgekehrt kann das Zusammenführen zweier tatsächlich verschiedener Patienten ein Signal unterdrücken.

Bei Produkten ist das Problem weniger intuitiv, aber genauso teuer. Ein einzelnes Biologikum kann im US-Abgabekanal einen NDC-Code tragen, einen anderen Identifier im 340B-System der Covered Entities, eine CIN aus einem GPO-Katalog und einen völlig eigenen Produktcode in der EU unter dem IDMP-Framework der EMA (Identification of Medicinal Products). Werden diese nicht zu einer Produktidentität aufgelöst, greift das staatliche Price Reporting, konkret die ASP- und AMP-Berechnungen für Medicaid und Medicare, auf nicht übereinstimmende Produktdatensätze zu. Das finanzielle Risiko daraus ist nicht theoretisch: CMS-Audits haben zu erheblichen Rückzahlungen von Herstellern geführt, und eine Haftung wegen False Claims folgt.

Wie funktioniert Identity Resolution in Pharma-Datensystemen?

Die Mechanik lässt sich in drei grobe Ansätze gliedern: deterministisches Matching, probabilistisches Matching und graphbasierte Resolution.

Deterministisches Matching ist exakt: Zwei Datensätze mit derselben NPI-Nummer (für US-HCPs) oder derselben DEA-Nummer meinen dieselbe Entität. Punkt. NPPES, das National Plan and Provider Enumeration System, ist die kanonische US-Quelle. Pharma-Datenteams, die ihr HCP-Master auf der NPI als Primary Key aufbauen und von dort aus anreichern, etwa über OneKey von IQVIA oder DDD von Wolters Kluwer Health, arbeiten mit dem saubersten verfügbaren Ausgangspunkt. Die Grenze liegt auf der Hand: Die NPI deckt nur US-Verordner ab, existiert nicht für Key Opinion Leaders, die nicht verordnen (Laborforscher, promovierte KOLs), und bietet keine grenzüberschreitende Verknüpfung für global tätige Unternehmen, die HCPs in der EU nachverfolgen.

Probabilistisches Matching greift, wenn deterministische Schlüssel fehlen oder sich widersprechen. Der Algorithmus bewertet Datensatzpaare anhand gewichteter Attribute: Nachname, Vorname, Fachrichtung, Adresse, Telefon, Abschlussjahr, zugehörige Institution. Eine Jaro-Winkler-Stringdistanz zwischen „Catherine Moreau“ und „C. Moreau-Dubois“ an derselben Klinikadresse in Lyon kann einen Match-Score von 0,87 ergeben. Die Matching-Engine wendet einen Schwellenwert an, etwa 0,80, um einen Match zu erklären, einen niedrigeren Schwellenwert, um den Fall zur manuellen Prüfung zu markieren, und darunter behandelt sie die Datensätze als verschieden.

Ein konkretes Beispiel: Ein europäisches Pharmaunternehmen führt ein neues onkologisches Biologikum in Frankreich, Deutschland und den Niederlanden ein. Das Medical-Affairs-Team hat 14.000 HCP-Datensätze von drei nationalen Distributoren, eine Teilnehmerliste der ESMO 2025 und eine Speaker-Engagement-Datenbank. Dieselbe Onkologin, Dr. Moreau, taucht in diesen Quellen viermal auf, jeweils anders geschrieben, verbunden mit zwei Kliniken (sie hat eine Doppelanstellung), in einem Datensatz mit französischem RPPS-Identifier, in einem anderen mit einer E-Mail-Adresse. Ein deterministischer Durchlauf matcht zwei der vier Datensätze über die RPPS. Die probabilistische Ebene löst den dritten über Namens- und Adressähnlichkeit auf. Der vierte, aus der ESMO-Liste, enthält nur ihren Namen und eine institutionelle E-Mail ihrer Zweitanbindung: Er geht in eine Queue zur manuellen Prüfung. Dieser Workflow, zuerst deterministisch, dann probabilistisch, dann menschliche Entscheidung, ist bei Unternehmen wie Roche und Sanofi der Produktionsstandard für die Pflege von HCP-Stammdaten.

Graphbasierte Resolution, seit 2026 zunehmend im Einsatz, modelliert Entitäten und ihre Beziehungen als Knoten und Kanten. Statt Datensatzpaare isoliert zu vergleichen, fragt sie: Teilt dieser ungelöste HCP-Datensatz eine institutionelle Anbindung, eine Ko-Autorenschaft und ein Verordnungs-Cluster nach PLZ mit einer bekannten Entität im Graphen? Unternehmen, die Identity Resolution auf Graphdatenbanken betreiben (Neo4j ist in diesem Feld verbreitet), stellen fest, dassder Golden Record aus Beziehungsevidenz entsteht, nicht allein aus Attributähnlichkeit, was den Recall bei besonders mobilen HCPs wie Klinikärzten, die zwischen Institutionen wechseln, deutlich verbessert.

Wann Identity Resolution volle Präzision braucht und wann nicht

Identity Resolution lohnt sich nicht in jedem Use Case in höchster Präzision.

Für Pharmakovigilanz und das Management von ICSRs (Individual Case Safety Reports) gibt es keine akzeptable Fehlerquote. FDA-Vorgaben nach 21 CFR Part 314 und GVP Modul VI der EMA verlangen eine korrekte Identifikation von Patient und Meldendem. Ein Duplikat, das die Zahl der Adverse Events für eine Substanz verdoppelt, kann eine regulatorische Sicherheitsprüfung auslösen. Hier investieren Sie kompromisslos in deterministische Resolution, verpflichtende Queues zur manuellen Prüfung und eine sauber governte Survivorship-Policy.

Für kommerzielles Targeting reicht probabilistisches Matching mit 85 bis 90 % Genauigkeit meist aus. Eine Fehlerquote von 5 % im HCP-Universum eines Veeva-CRM bedeutet, dass manche Reps die falsche Dezilstufe besuchen oder einen neu wichtigen Verordner verpassen. Kommerziell zählt das, ein rechtliches Risiko entsteht dadurch aber nicht von selbst, es sei denn,die Fehler fließen in die Auswahl für Speaker Bureaus oder in Grant-Entscheidungen ein, wo Anti-Kickback-Prüfungen greifen.

Bei Real-World-Evidence-Studien hängt der Schwellenwert vom regulatorischen Pfad ab. Eine RWE-Studie zur Unterstützung einer Label-Erweiterung, die der FDA nach den Bestimmungen des 21st Century Cures Act vorgelegt wird, wird beim Patient Matching methodisch streng geprüft. Eine interne HEOR-Analyse, die die Vertragsstrategie mit Kostenträgern unterfüttert, hat mehr Spielraum.

Der ehrliche Tradeoff lautet: Identity Resolution auf Enterprise-Niveau verlangt dauerhafte Investitionen in Data Stewardship, nicht nur in Tooling. Anbieter wie IQVIA, Veeva und Komodo Health verkaufen vorab aufgelöste HCP- und Patienten-Universen als Produkt, was die Build-Kosten senkt, aber das Governance-Risiko verlagert. Wenn deren Matching falsch ist, ist die Korrektur in den eigenen Systemen, ohne den Primary Key des Anbieters zu überschreiben, ein architektonisch alles andere als triviales Problem.

Die CDOs, die das richtig machen, behandeln Identity Resolution als Infrastruktur im Verantwortungsbereich der Data Governance, nicht als Feature einer einzelnen kommerziellen Anwendung. Diese Unterscheidung entscheidet darüber, ob der Golden Record einen Produkt-Launch, eine Fusion und eine behördliche Inspektion übersteht.

Der vollständige Kurs zu dieser Branche:Daten in der Pharmaindustrie.

Häufige Fragen

Was ist Identity Resolution in der Pharmabranche?

Identity Resolution ist der Prozess, festzustellen, dass Datensätze aus getrennten Quellen dieselbe reale Entität meinen: einen Healthcare Professional, einen Patienten oder ein Produkt. In Pharma laufen diese drei Identitätsdomänen parallel, etwa wenn ein Arzt gleichzeitig im Veeva-CRM, in IQVIA-Prescriber-Daten und in einem Adverse-Event-Report auftaucht.

Welche Match-Genauigkeit reicht für kommerzielles HCP-Targeting aus?

Für kommerzielles Targeting genügt probabilistisches Matching mit 85 bis 90 % Genauigkeit. Eine Fehlerquote von 5 % im HCP-Universum eines Veeva-CRM heißt, dass Reps die falsche Dezilstufe besuchen oder einen neuen Verordner verpassen. Rechtlich heikel wird es erst, wenn diese Fehler in Speaker-Bureau-Auswahl oder Grant-Entscheidungen einfließen, wo Anti-Kickback-Prüfungen greifen.

Warum reicht die NPI-Nummer als HCP-Schlüssel nicht aus?

Die NPI aus NPPES ist der sauberste deterministische Schlüssel, deckt aber nur US-Verordner ab. Für Key Opinion Leaders ohne Verordnungstätigkeit, etwa Laborforscher, existiert sie nicht, und eine grenzüberschreitende Verknüpfung zu HCPs in der EU liefert sie ebenfalls nicht. Dort helfen nationale Identifier wie die französische RPPS plus probabilistisches Matching.

Welches Risiko entsteht durch Duplikate in der Pharmakovigilanz?

Ein doppelt erfasstes Adverse Event kann das Sicherheitssignal einer Substanz aufblähen und eine regulatorische Sicherheitsprüfung auslösen, während das falsche Zusammenführen zweier Patienten ein Signal unterdrückt. FDA-Vorgaben nach 21 CFR Part 314 und GVP Modul VI der EMA verlangen eine korrekte Identifikation von Patient und Meldendem, ohne akzeptable Fehlerquote.

Mehr dazu

Die Lektionen, die diesen Artikel weiterführen, frei zugänglich.

  1. 1Master Data Management in der Praxis: Styles, Tools und der Golden RecordData Governance & Compliance
  2. 2Datenqualitätsmetriken, die zählen: Completeness, Latency und LineageDaten in der Pharmaindustrie
  3. 3Die Pharma-Datenlandschaft kartieren: Quellen, Anbieter und StandardsDaten in der Pharmaindustrie
  4. 4Consent, De-Identification und die Grenzen anonymer DatenDaten in der Pharmaindustrie
  5. 5Marketing an der kurzen Leine: Promotional Compliance und das Anti-Kickback-MinenfeldPharma: Wie die Branche funktioniert

Artikel gelesen?

Bestätigen Sie Ihre Lektüre, um XP zu sammeln und Ihr Radar zu füttern.