+150 XP

Les métriques de qualité de données qui comptent : complétude, latence et lineage

L'entrepôt de données de remboursement d'un assureur santé affiche un décalage moyen de 74 jours entre le moment où un patient retire une ordonnance et celui où cet enregistrement devient exploitable pour l'analyse. Une équipe de pharmacovigilance qui extrait des données pour un exercice de détection de signal ne le remarque pas, lance quand même sa requête, et conclut qu'un taux d'événements indésirables est en baisse. Il n'est pas en baisse. Les 10 dernières semaines de données de remboursement ne sont tout simplement pas encore arrivées. C'est ainsi que la real-world evidence (RWE, données générées en dehors des essais cliniques, issues des remboursements, des dossiers médicaux électroniques ou des registres) dérape : non pas par mauvaise science, mais par qualité de données non mesurée.

Cette leçon vous donne trois métriques à vérifier avant de faire confiance à un jeu de données pharma : complétude, latence et lineage.

Pourquoi les checklists génériques de qualité de données échouent en pharma

La plupart des frameworks de qualité de données d'entreprise (comptages de défauts façon Six Sigma ou dashboards génériques de « taux de valeurs nulles ») ont été conçus pour des transactions retail ou des grands livres comptables. Les données pharma ont d'autres modes de défaillance :

  • Les données de remboursement sont administratives, construites pour la facturation, pas pour l'exactitude clinique. Un code diagnostic peut être présent uniquement pour justifier un paiement, et non parce qu'il s'agit de la pathologie principale.
  • Les données d'EHR (electronic health record, dossier médical électronique) sont non structurées et incohérentes d'un système hospitalier à l'autre. Sur un site, le champ « statut tabagique » sera du texte libre ; sur un autre, un menu déroulant.
  • Les registres (bases de données structurées suivant des patients porteurs d'une maladie ou d'un dispositif spécifique) reposent sur une saisie manuelle, souvent par des coordinateurs cliniques en sous-effectif.

Chaque source exige des dimensions de qualité adaptées à sa façon de casser.

Les trois métriques les plus importantes

1. Complétude : ce qui est réellement présent

La complétude mesure la proportion de champs, d'enregistrements ou de périodes attendus qui sont effectivement renseignés.

Exemple : dans un jeu de données EHR en oncologie, un point faible fréquent concerne les résultats de tests de biomarqueurs (par exemple le statut HER2 dans le cancer du sein). Les estimations du secteur suggèrent que les champs structurés de biomarqueurs sont manquants dans environ 30 à 50 % des jeux de données oncologiques issus d'EHR, d'après les études RWE publiées récemment (estimation, très variable selon le fournisseur de données et le type de cancer). Si votre analyse dépend du statut biomarqueur pour définir une population de patients, cette absence n'est pas une erreur d'arrondi : elle peut invalider entièrement votre définition de cohorte.

Exemple chiffré :

Supposons que vous extrayiez 10 000 dossiers patients pour une étude RWE sur le cancer du poumon. Vous avez besoin du statut mutationnel EGFR (un biomarqueur guidant le choix d'une thérapie ciblée).

  • Dossiers avec le champ EGFR renseigné : 6 200
  • Taux de complétude = 6 200 / 10 000 = 62 %

Si l'absence de données est aléatoire, vous pouvez repondérer ou imputer. Si elle est corrélée à quelque chose de significatif, par exemple si les centres d'oncologie de ville testent moins souvent que les centres académiques, alors vos 62 % restants constituent un échantillon biaisé, pas une version réduite de la vérité. Vérifiez toujours les *patterns* de données manquantes, pas seulement leur *taux*.

2. Latence : à quel point le « temps réel » est-il périmé

La latence est le décalage entre la survenue d'un événement et le moment où la donnée le reflète dans votre jeu de données.

Dans les données de remboursement américaines, un benchmark souvent cité veut que 70 à 90 % des demandes médicales soient soumises et traitées sous 90 jours, mais le « run-out » complet (toutes les demandes intégralement traitées, y compris les soumissions tardives et les corrections) peut prendre 6 à 12 mois (estimation, fondée sur les schémas de latence typiques des payeurs). Les sources européennes, comme les registres de délivrance pharmaceutique dans les pays nordiques, présentent souvent un délai plus court (des semaines, pas des mois) grâce à des systèmes de santé nationaux centralisés, mais les données EHR hospitalières varient énormément selon le pays et la maturité du système au sein de l'UE.

Concrètement, pourquoi cela compte : si vous surveillez des signaux de sécurité pour un produit récemment lancé, un délai de remontée de 3 à 6 mois signifie que votre dashboard « actuel » décrit un marché qui existait il y a deux trimestres. Les autorités comme la FDA (Food and Drug Administration) et l'EMA (European Medicines Agency) en tiennent explicitement compte dans les protocoles de pharmacovigilance (surveillance de la sécurité des médicaments) en définissant des fenêtres d'observation minimales avant de tirer des conclusions à partir de signaux issus des données de remboursement.

3. Lineage : pouvez-vous remonter la piste

Le lineage est la trace documentée de la provenance des données, des transformations qu'elles ont subies et des personnes qui les ont manipulées avant qu'elles n'arrivent dans votre table.

Sans lineage, vous ne pouvez pas répondre à des questions d'audit élémentaires : ce code diagnostic a-t-il été correctement mappé de la CIM-9 à la CIM-10 (Classification internationale des maladies, le système de codage standard des diagnostics) ? Un « rafraîchissement de données » chez un fournisseur a-t-il silencieusement modifié la définition d'un champ le trimestre dernier ?

La surveillance réglementaire rend ce point non négociable. La guidance de la FDA sur la real-world evidence (partie du framework issu du 21st Century Cures Act) demande explicitement aux sponsors de documenter la provenance des données lorsqu'ils soumettent de la RWE à l'appui de décisions réglementaires. Dans l'UE, le règlement European Health Data Space (EHDS), entrant en vigueur par phases de 2025 à 2027, fixe des exigences de traçabilité pour les données de santé utilisées en recherche secondaire. Pas de trace de lineage, pas de soumission crédible.

Un exercice de scoring simple

Voici une manière légère de scorer un jeu de données avant de vous y fier. Pas un audit complet, mais un point de contrôle.

Dataset: Regional EHR extract, diabetes cohort, n=45,000

1. Completeness (key fields: HbA1c, medication list, BMI)
   populated_fields / expected_fields = 38,000 / 45,000 = 84%

2. Latency (event date vs. data availability date)
   median_lag_days = 21
   Benchmark: acceptable for chronic disease monitoring (<30 days)
   Flag: NOT acceptable for acute safety signal detection

3. Lineage
   - Source system documented? Yes (Epic EHR, single health system)
   - Coding standard documented? Yes (ICD-10, RxNorm for meds)
   - Transformation log available? No <- FAIL

Overall gate decision: CONDITIONAL PASS
Do not use for regulatory submission until transformation log is obtained.

Ce type de contrôle, exécuté avant le démarrage de l'analyse, intercepte l'erreur de notre scène d'ouverture avant qu'elle ne devienne une conclusion fausse dans un slide.

Pour une référence plus approfondie sur les frameworks structurés de qualité de données RWE, la documentation qualité de données de la Sentinel Initiative (un système de surveillance active financé par la FDA) est une ressource publique réellement utile, qui montre comment un système de niveau régulateur codifie ces contrôles à grande échelle.

Vérification des acquis

1. Dans le scénario d'ouverture, pourquoi l'équipe de pharmacovigilance a-t-elle conclu à tort qu'un taux d'événements indésirables était en baisse ?

2. Pourquoi les frameworks génériques de qualité de données d'entreprise (par exemple les comptages de défauts façon Six Sigma) échouent-ils souvent appliqués aux données pharma ?

3. Un chercheur veut utiliser un jeu de données de remboursement pour identifier les diagnostics principaux de patients dans une étude d'exactitude clinique. Quel est le risque clé à considérer ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les bonnes réponses expliquant pourquoi la qualité des données EHR varie fortement d'un site hospitalier à l'autre.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les bonnes réponses décrivant ce que mesure la « complétude » comme métrique de qualité de données dans les jeux de données pharma.

Sélectionnez toutes les réponses correctes.

Ce qui change quand vous appliquez ces métriques

Une fois un jeu de données scoré, vos conclusions doivent se réduire à ce que les données permettent d'affirmer.

  • Une complétude faible sur une variable clé signifie que vous resserrez votre affirmation de « prévalence dans la population » à « prévalence chez les patients pour lesquels la variable est enregistrée », un énoncé matériellement différent et plus limité.
  • Une latence élevée signifie que les tendances du trimestre récent sont provisoires. Les analystes doivent signaler les 1 à 2 dernières périodes de reporting comme incomplètes plutôt que de les présenter comme définitives.
  • Un lineage faible signifie que le jeu de données peut servir à générer des hypothèses en interne, mais pas à alimenter un dossier réglementaire ou une négociation avec un payeur, où les évaluateurs de la FDA ou de l'EMA, ou les organismes d'évaluation des technologies de santé (HTA) comme le NICE (National Institute for Health and Care Excellence, Royaume-Uni) ou l'IQWiG allemand, exigeront une provenance complète.

Voilà la discipline de fond : les métriques de qualité de données ne se contentent pas de noter un jeu de données, elles définissent la limite de ce que vous avez le droit d'en dire.

🎬 [VIDEO: "Real-World Evidence: What It Is and Why It Matters" - youtube.com/results?search_query=real+world+evidence+fda+explained - chercher des vidéos explicatives produites par la FDA ou l'ISPOR couvrant les fondamentaux de la qualité des données RWE et les cas d'usage réglementaires]

Points clés

  • La complétude mesure ce qui est renseigné, mais vérifiez les *patterns* de données manquantes, pas seulement le pourcentage brut ; une absence biaisée déforme silencieusement votre cohorte.
  • La latence détermine à quel point vos données sont réellement « à jour ». Les données de remboursement américaines peuvent accuser 3 à 12 mois de décalage jusqu'au run-out complet (estimation) ; alignez toujours votre fenêtre de reporting sur la question posée (suivi chronique vs signaux de sécurité aigus).
  • Le lineage est ce qui rend une donnée exploitable pour des soumissions réglementaires ou HTA. Sans provenance documentée, pas de piste d'audit crédible, quelle que soit la propreté apparente des chiffres.
  • Faites un contrôle rapide à trois métriques (complétude, latence, lineage) avant toute analyse, pas après. Il est plus rapide de repérer un jeu de données périmé ou biaisé à l'entrée que de rétracter une conclusion plus tard.
  • Les cadres réglementaires (guidance RWE de la FDA, processus de l'EMA, EHDS européen) exigent de plus en plus exactement ce type d'assessment documenté de la qualité des données : prendre l'habitude dès maintenant est aussi une compétence de conformité, pas seulement d'analyse.

Articles liés

Les articles récents du blog qui s'appuient sur cette leçon.