+150 XP

Gouverner les données avec FAIR et les métriques de stewardship

Un sponsor pharma vous pose une question simple sur votre référentiel multi-omique : « Combien de nos 4 200 datasets un collaborateur externe peut-il trouver, consulter et réutiliser sans écrire à votre équipe ? » Si la réponse est un haussement d'épaules, vous avez un problème de gouvernance, pas un problème de science. En 2026, c'est cet écart qui bloque les collaborations, retarde les soumissions réglementaires et fait capoter les renouvellements de financement.

Cette leçon transforme FAIR, d'une affiche au mur, en KPIs que vous pouvez présenter aux sponsors et aux régulateurs.

Ce que FAIR veut dire concrètement

FAIR est un ensemble de principes de données publiés en 2016 (Wilkinson et al., dans *Scientific Data*). L'acronyme signifie Findable, Accessible, Interoperable, Reusable. Il s'agit de permettre aux machines et aux humains de travailler avec vos données, pas de tout rendre public. FAIR n'est pas synonyme d'open.

  • Findable : le dataset possède un identifiant pérenne et des métadonnées riches (les données sur les données : qui, quoi, quand, comment c'est mesuré).
  • Accessible : on peut le récupérer via un protocole standard, avec des règles claires sur qui y accède.
  • Interoperable : il utilise des vocabulaires et formats partagés, pour qu'un fichier protéomique et un fichier génomique puissent être joints.
  • Reusable : il a une licence claire, une provenance (la trace de l'origine des données et de leur traitement) et assez de contexte pour lui faire confiance.

La référence d'origine : **les principes FAIR sur GO FAIR**.

Pourquoi le multi-omique complique la tâche

Le multi-omique consiste à combiner des couches : génomique (ADN), transcriptomique (ARN), protéomique (protéines), métabolomique (petites molécules). Chaque couche a ses propres formats de fichiers, identifiants et référentiels. Un seul échantillon patient peut générer un fichier VCF (Variant Call Format, pour les variants génétiques), un fichier FASTQ (lectures de séquençage brutes) et des sorties de spectrométrie de masse pour les protéines. Sans métadonnées partagées, ces éléments ne sont jamais rattachés au même biosample.

Les standards de métadonnées que vous citerez vraiment

N'inventez pas votre propre schéma. Les régulateurs et les sponsors font confiance aux standards communautaires. Nommez les vrais :

  • Framework ISA (Investigation, Study, Assay) : un modèle de description des expériences.
  • MIAME / MINSEQE : standards d'information minimale pour les expériences de puces à ADN et de séquençage.
  • HL7 FHIR (Fast Healthcare Interoperability Resources) : le standard d'échange de données cliniques et de santé, pertinent quand l'omique se rattache aux dossiers patients.
  • CDISC SDTM (Study Data Tabulation Model) : exigé par la FDA américaine (Food and Drug Administration) et la PMDA japonaise pour les soumissions d'essais cliniques.
  • Ontologies : EFO (Experimental Factor Ontology), MONDO (ontologie des maladies) et Uberon (anatomie) fournissent des vocabulaires contrôlés pour que « cancer du sein », « BRCA » et « carcinome mammaire » pointent vers un seul code.

Référentiels publics de référence qui appliquent déjà FAIR : les ressources EMBL-EBI de l'Institut européen de bioinformatique (dont l'European Genome-phenome Archive, EGA, pour les données humaines à accès contrôlé), et dbGaP et GEO du NCBI américain.

Les métriques de stewardship

Le stewardship est le travail continu qui consiste à maintenir la gouvernance des données : attribuer des propriétaires, faire appliquer les standards et mesurer la conformité. On ne pilote pas ce qu'on ne compte pas. Voici les KPIs qui comptent, regroupés par pilier FAIR.

KPIs de findability

  • Couverture PID : pourcentage de datasets dotés d'un identifiant pérenne (un DOI, Digital Object Identifier, ou un numéro d'accession). Cible : viser 100 pour cent pour tout ce qui est partagé en externe.
  • Complétude des métadonnées : pourcentage de champs de métadonnées requis renseignés par rapport à votre schéma.
  • Taux de succès des recherches : part des recherches internes qui renvoient le dataset visé dans les premiers résultats.

KPIs d'accessibilité et de réutilisation

  • Délai de traitement des demandes d'accès : nombre médian de jours entre une demande d'accès contrôlé et une décision. Pour les données génomiques humaines encadrées par un Data Access Committee, c'est un vrai goulot d'étranglement.
  • Nombre de réutilisations : nombre de téléchargements ou de citations distincts par dataset.
  • Clarté des licences : pourcentage de datasets avec une licence lisible par machine.

Un calcul détaillé : le score de complétude FAIR

Supposons que votre schéma exige 10 champs de métadonnées obligatoires par dataset. Vous auditez un échantillon de 200 datasets sur un référentiel de 4 200.

python
# Score de complétude des métadonnées (illustratif)
required_fields = 10
sample = 200
# résultat de l'audit : total des champs renseignés sur l'échantillon
fields_populated = 1_540

completeness = fields_populated / (sample * required_fields)
print(f"Metadata completeness: {completeness:.0%}")
# Metadata completeness: 77%

77 pour cent de complétude indique au sponsor exactement où vous en êtes. Pondérez maintenant : si les 3 champs critiques pour la findability (identifiant, titre, type d'assay) ne sont renseignés qu'à 60 pour cent, votre findability est pire que le chiffre global ne le laisse croire. Présentez la vue pondérée, pas seulement la moyenne.

Le délai de traitement, deuxième exemple chiffré

Le délai médian de traitement des demandes d'accès est une métrique de stewardship que les régulateurs remarquent. Si au T1 vous avez enregistré des délais de décision de 3, 5, 8, 12 et 40 jours, la moyenne (13,6 jours) est tirée vers le haut par une valeur aberrante. La médiane (8 jours) est le chiffre honnête. Rapportez toujours des médianes pour les délais, et suivez le 90e percentile séparément pour que les cas lents restent visibles.

Benchmarks et estimations (début 2026)

Les benchmarks FAIR solides et inter-sectoriels sont rares : traitez tous ces chiffres comme des ordres de grandeur, pas comme des standards audités.

  • Les études sur les datasets publiés en sciences de la vie ont montré à plusieurs reprises qu'une large part manque de métadonnées suffisantes pour la réutilisation. Une analyse de 2020 largement citée dans *PLOS Biology* sur la reproductibilité, et plusieurs évaluations de maturité FAIR depuis, suggèrent que la plupart des datasets legacy sont loin d'une conformité FAIR complète. Partez du principe que votre référentiel legacy non entretenu est plus proche de 40 à 60 pour cent de complétude que de 90 pour cent, tant que vous n'avez pas mesuré.
  • Les indicateurs de maturité FAIR de la RDA (Research Data Alliance) fournissent une auto-évaluation structurée. Des outils comme les services d'évaluation FAIR aident à scorer les datasets par rapport aux standards communautaires.
  • Dans l'UE, la dynamique est renforcée par la politique publique : les financements Horizon Europe exigent des plans de gestion de données FAIR, et le règlement European Health Data Space (EHDS), adopté en 2025, fixe les règles d'usage secondaire des données de santé entre États membres. Aux États-Unis, la NIH Data Management and Sharing Policy (en vigueur depuis janvier 2023) impose aux chercheurs financés de prévoir le partage des données.

Établissez votre propre baseline, puis suivez la progression trimestre après trimestre. Une cible réaliste pour la première année : faire passer la findability (couverture PID plus complétude des champs critiques) de la baseline à 90 pour cent pour tous les datasets partagés en externe.

🎬 [VIDEO: "The FAIR Guiding Principles for scientific data" - youtube.com - une explication concise des quatre principes avec des exemples en sciences de la vie]

Vérification des acquis

1. Une équipe affirme que rendre son référentiel multi-omique FAIR impose de publier tous les datasets ouvertement au public. Pourquoi ce raisonnement est-il faux ?

2. La question du sponsor, « Combien de datasets un collaborateur externe peut-il trouver, consulter et réutiliser sans écrire à votre équipe ? », révèle selon la leçon quel type de problème ?

3. Pourquoi les données multi-omiques posent-elles un défi particulier au principe « Interoperable » de FAIR ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les bonnes réponses. Quels éléments sont indispensables pour satisfaire le principe « Reusable » de FAIR ?

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les bonnes réponses. Faire passer FAIR de « l'affiche au mur » à une gouvernance dont vous pouvez rendre compte suppose quoi ?

Sélectionnez toutes les réponses correctes.

Construire le modèle opérationnel de gouvernance

Des métriques sans propriétaires, c'est de la décoration. Attribuez les rôles :

  • Data steward : propriétaire d'un domaine de données (par exemple, tous les assays protéomiques), fait appliquer le schéma et répond aux questions d'audit.
  • Data custodian : exploite l'infrastructure de stockage et d'accès.
  • Data Access Committee (DAC) : pour les données humaines à accès contrôlé, décide qui peut les réutiliser et à quelles conditions. C'est une attente réglementaire, pas une option, dès qu'on manipule des données génomiques identifiantes.

La gouvernance en pratique : un workflow de référentiel

  1. À l'ingestion, rejetez tout dataset auquel il manque des champs obligatoires. Faites du schéma une barrière, pas une suggestion.
  2. Attribuez automatiquement un PID à l'ingestion, pour que la findability ne soit jamais rajoutée après coup.
  3. Mappez le texte libre sur des ontologies (EFO, MONDO) pour que la recherche et l'interopérabilité fonctionnent.
  4. Taguez la licence et le niveau d'accès (open, enregistré, contrôlé).
  5. Journalisez chaque demande d'accès et chaque téléchargement pour que les KPIs de réutilisation et de délai se calculent automatiquement.

Le lien avec la réglementation

Quand vous soumettez à la FDA ou à l'EMA (European Medicines Agency), la provenance et la traçabilité sont tout l'enjeu. Sous 21 CFR Part 11 (la règle de la FDA américaine sur les enregistrements et signatures électroniques) et l'Annexe 11 de l'UE, vous devez montrer des audit trails : qui a modifié quoi, quand et pourquoi. Vos métriques de stewardship servent aussi de preuve de conformité. Une chaîne de provenance complète et une licence lisible par machine, c'est exactement ce qu'un inspecteur ou l'équipe d'audit d'un sponsor veut voir.

L'angle RGPD (Règlement général sur la protection des données) compte aussi : le « Accessible » de FAIR ne signifie jamais contourner le consentement. Pour les données humaines, « aussi ouvert que possible, aussi fermé que nécessaire » est le principe opérationnel. L'accès contrôlé via un DAC, c'est ainsi que FAIR et vie privée coexistent.

Rendre compte aux sponsors et aux régulateurs

Mettez les KPIs sur un seul dashboard, rafraîchi tous les mois :

MétriqueBaselineCibleActuel
Couverture PID (externe)62 %100 %91 %
Complétude des métadonnées (pondérée)55 %90 %78 %
Délai médian de traitement des accès (jours)2179
Datasets avec licence lisible par machine40 %95 %88 %

(Chiffres illustratifs.) Cette vue unique répond à la question initiale du sponsor, et transforme le « faites-nous confiance » en un chiffre.

Points clés

  • FAIR est mesurable : suivez la couverture PID, la complétude pondérée des métadonnées, les délais d'accès et les comptes de réutilisation, pas une vague « conformité ».
  • Utilisez de vrais standards communautaires (ISA, CDISC SDTM, HL7 FHIR, et des ontologies comme EFO et MONDO) pour que régulateurs et collaborateurs fassent confiance à vos métadonnées.
  • Rapportez médianes et 90es percentiles pour les délais, et pondérez la complétude vers les champs critiques pour la findability, pour que les chiffres globaux n'induisent pas en erreur.
  • FAIR n'est pas open : l'accès contrôlé via un Data Access Committee permet de satisfaire en même temps le RGPD, l'EHDS et les règles de partage du NIH.
  • Vos métriques de stewardship sont aussi des preuves d'audit pour 21 CFR Part 11 et l'Annexe 11 de l'UE : le travail de gouvernance paie deux fois.