+150 XP

Sourcing et licensing de datasets externes

Une équipe de data science hospitalière veut modéliser le risque de réadmission à 30 jours après pose d'un stent cardiaque. Elle peut licencier les données de claims dé-identifiées d'Optum pour à peu près le coût d'un recrutement senior, ou passer neuf mois à négocier l'accès à MIMIC et à assembler des registres SEER gratuitement. Les deux voies se défendent. Se tromper coûte une année et un budget, parfois un audit réglementaire.

Cette leçon porte sur ce choix : quand acheter de la donnée externe, quand construire l'accès à des sources publiques, et comment juger de la fitness pour un usage régulé.

Les quatre datasets que vous croiserez sans cesse

Avant de comparer, connaissez les acteurs. Ces quatre-là apparaissent dans presque toutes les conversations data en biotech et medtech aux États-Unis.

SEER (Surveillance, Epidemiology, and End Results) : un registre du cancer géré par le National Cancer Institute américain. Il couvre environ 48 % de la population américaine sur une sélection d'États et de régions (d'après la documentation NCI récente, vérifiez la couverture actuelle). Gratuit, de grande qualité, gold standard pour l'incidence et la survie en cancérologie. Faible sur le détail des traitements et les comorbidités.

MIMIC (Medical Information Mart for Intensive Care) : données de réanimation dé-identifiées du Beth Israel Deaconess Medical Center à Boston, publiées via PhysioNet. Gratuit, mais mono-institution. Extrêmement riche (constantes, biologie, notes, signaux) pour des dizaines de milliers de séjours en réanimation. Excellent pour développer des méthodes, faible en généralisabilité nationale.

Claims Optum : un large dataset de claims commerciaux et Medicare Advantage vendu par Optum (groupe UnitedHealth). Couvre des centaines de millions de vies dans le temps. Les claims disent ce qui a été facturé, pas ce qui s'est passé cliniquement. Licence commerciale, tarifée par projet ou par abonnement.

MAUDE (Manufacturer and User Facility Device Experience) : la base de la FDA des déclarations d'événements indésirables liés aux dispositifs médicaux. Gratuite, publique, indispensable pour les signaux de sécurité des dispositifs. Notoirement sale : déclaration volontaire, doublons, et aucun dénominateur (vous connaissez le nombre de défaillances déclarées, pas le nombre de dispositifs en usage).

Acheter ou construire : le vrai arbitrage

« Construire » signifie ici investir du temps d'équipe pour accéder à des données publiques gratuites ou peu coûteuses et les industrialiser. « Acheter » signifie licencier un dataset commercial qui arrive nettoyé et documenté.

La décision ne porte pas d'abord sur l'argent. Elle porte sur quatre axes.

Couverture

Question : la source représente-t-elle la population sur laquelle vous allez déployer ?

MIMIC, c'est une réanimation de Boston. Si vous entraînez un modèle de sepsis là-dessus et le déployez dans un hôpital rural du Texas, attendez-vous à du drift. Optum penche vers les assurés commerciaux et les membres Medicare Advantage, donc sous-représente Medicaid et les non-assurés. SEER couvre bien le cancer, mais seulement dans ses régions de registre.

Une règle concrète : alignez la population source sur votre population cible en âge, mix payeur et géographie avant toute autre chose.

Coût

La donnée publique est gratuite à télécharger mais coûteuse à utiliser. La donnée commerciale est coûteuse à licencier mais peu coûteuse à utiliser.

Exemple chiffré. Supposons que licencier Optum pour un projet d'un an coûte environ 250 000 dollars (à titre indicatif, pas un prix coté). Construire un accès équivalent depuis des sources publiques demande 2 data engineers pendant 6 mois.

Loaded cost per engineer/month (fully burdened) = 18,000 USD (estimate)
2 engineers x 6 months x 18,000 = 216,000 USD
Plus 40,000 USD compliance/legal review
Build total ≈ 256,000 USD

Les coûts affichés sont proches. Ce qui départage, c'est ce que vous obtenez : la version construite est sur mesure et vous possédez le pipeline ; la version achetée est plus rapide et supportée par le vendor, mais récurrente. Modélisez la deuxième année, pas seulement la première.

Consentement et base légale

C'est là que l'usage régulé se joue.

Aux États-Unis, HIPAA (Health Insurance Portability and Accountability Act) encadre les protected health information. Les données dé-identifiées (via les méthodes Safe Harbor ou Expert Determination de HIPAA) peuvent être utilisées plus librement. SEER, MIMIC et Optum sont toutes dé-identifiées, mais les standards et le risque résiduel de ré-identification diffèrent.

En Europe, le RGPD (Règlement général sur la protection des données) est plus strict. Les données de santé sont une « catégorie particulière » exigeant une base légale explicite. « Dé-identifié » au sens HIPAA n'est pas automatiquement « anonymisé » au sens RGPD ; si la ré-identification est raisonnablement possible, le RGPD s'applique encore. Un dataset de claims américain licencié pour un essai européen peut créer un écart de conformité ici.

MIMIC impose une étape spécifique : suivre la formation CITI (Collaborative Institutional Training Initiative) à la recherche sur sujets humains et signer un data use agreement sur PhysioNet avant téléchargement. Gratuit ne veut pas dire sans friction.

Le processus de credentialing PhysioNet est un bon exemple concret de ce à quoi ressemble un vrai DUA (data use agreement).

Fitness pour un usage régulé

Si votre livrable soutient un dossier FDA, une revendication d'étiquetage ou un dossier de remboursement, le niveau d'exigence monte fortement.

La FDA évalue de plus en plus la RWE (real-world evidence) issue de RWD (real-world data) comme les claims et les registres. Ses guidances insistent sur la pertinence et la fiabilité des données : provenance, complétude, et capacité des données à capter le concept clinique que vous prétendez mesurer.

MAUDE illustre le piège. Parfait pour générer des hypothèses (« voit-on davantage de déclarations de fractures de sonde ? ») et inutile comme taux (« notre taux de défaillance est X »), parce qu'il n'y a pas de dénominateur. Utiliser MAUDE pour revendiquer un taux de défaillance dans un dossier réglementaire est une erreur de fitness classique.

🎬 [VIDEO: "Real-World Evidence in Regulatory Decision-Making" - youtube.com - Panorama FDA et académique de la façon dont les sources de RWD sont évaluées pour les dossiers]

Un framework de scoring rapide

Notez chaque source candidate de 1 à 5 sur les quatre axes, puis pondérez selon votre cas d'usage.

AxeSEERMIMICOptumMAUDE
Couverture4243
Efficience coût5525
Clarté du consentement5434
Fitness régulée4242

Ce sont des jugements indicatifs pour un projet analytics américain typique, pas des vérités universelles. Une équipe de développement méthodologique pondérerait faiblement la couverture et fortement la richesse, ce qui inverse l'attractivité de MIMIC. Construisez vos propres pondérations avant de noter.

Pour un dossier réglementaire, pondérez fortement la « fitness régulée » et Optum ou SEER passent devant. Pour un prototype d'algorithme précoce, pondérez coût et richesse et MIMIC gagne.

Vérification des acquis

1. Une équipe doit modéliser les tendances nationales de survie au cancer et a besoin des données d'incidence et de survie de la plus haute qualité, même si le détail des traitements est pauvre. Quel dataset convient le mieux ?

2. Pourquoi l'extrait prévient-il que les données de claims « disent ce qui a été facturé, pas ce qui s'est passé cliniquement » ?

3. MAUDE est décrit comme n'ayant « aucun dénominateur ». Quelle limite analytique cela crée-t-il ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les bonnes réponses. Un dataset est « gratuit » comme MIMIC mais décrit comme faible en généralisabilité nationale. Quelles raisons soutiennent cette inquiétude ?

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les bonnes réponses. Pour décider entre licencier de la donnée commerciale et construire l'accès à des sources publiques, quels arbitrages la leçon met-elle en avant ?

Sélectionnez toutes les réponses correctes.

Le linkage : la troisième option cachée

Souvent la réponse n'est ni acheter pur ni construire pur. C'est le linkage.

La tokenisation permet de joindre des datasets sur des tokens patients dé-identifiés sans exposer les identités. Des vendors comme Datavant assurent ce courtage. Vous pouvez lier les registres cancer SEER aux claims Medicare (le dataset lié SEER-Medicare, réel et établi, maintenu par le NCI et le CMS) pour obtenir incidence, traitement et coût dans une seule vue.

SEER-Medicare mérite d'être connu comme modèle : il corrige la faiblesse de SEER (données de traitement pauvres) en joignant les claims CMS (Centers for Medicare and Medicaid Services). La couverture est limitée à la population d'âge Medicare, donc la généralisabilité aux patients plus jeunes est faible. Chaque linkage achète de la richesse et coûte de la généralisabilité quelque part.

Checklist de due diligence pratique

Avant de signer une licence ou de télécharger un jeu public, obtenez des réponses écrites à :

  • Provenance : d'où vient chaque enregistrement, et par combien de mains est-il passé ?
  • Cadence de rafraîchissement : est-ce un extrait statique ou une mise à jour trimestrielle ? Les claims ont 3 à 6 mois de décalage pour l'ajustement (estimation).
  • Méthode de dé-identification : Safe Harbor ou Expert Determination ? Qui l'a certifiée ?
  • Dénominateur : pouvez-vous calculer un taux, ou seulement des comptages ? (La leçon MAUDE.)
  • Droit d'usage pour votre finalité : beaucoup de DUA interdisent l'usage commercial ou un dossier FDA. Lisez la clause.
  • Périmètre géographique : la licence couvre-t-elle l'usage par votre filiale européenne sous RGPD ?

Une page de réponses à ces six questions évite la plupart des erreurs coûteuses.

Points clés

  • Alignez la population avant le prix. Un décalage de couverture (MIMIC mono-site, Optum biaisé commercial) provoque un drift de modèle qu'aucun budget ne rattrape ensuite.
  • La donnée gratuite a un coût réel, et acheter ou construire converge souvent vers des totaux proches. Faites le calcul chiffré sur deux ans, compliance et temps d'ingénierie inclus.
  • Dé-identifié sous HIPAA n'est pas anonymisé sous RGPD. Une licence américaine peut laisser un écart de conformité en Europe ; vérifiez le périmètre géographique dans le DUA.
  • Jugez la fitness à l'aune de la revendication que vous ferez. MAUDE génère des hypothèses mais ne fournit pas un taux de défaillance ; SEER et Optum pèsent davantage pour des dossiers RWE auprès de la FDA.
  • Envisagez le linkage comme troisième voie intelligente. SEER-Medicare et les jointures tokenisées achètent de la richesse, mais chaque linkage cède de la généralisabilité. Nommez explicitement cet arbitrage.