+150 XP

Métriques de data governance : lineage, accès et santé du stewardship

Le data catalog d'une agence publique de l'emploi recense 340 datasets. Demandez qui est propriétaire de « demandes d'allocations chômage 2023 » : la réponse est un fil Slack de 2021. Demandez combien de temps il faut pour obtenir l'accès à ce dataset dans le cadre d'un audit anti-fraude, et la réponse honnête est « six à huit semaines, parfois ». Cette agence a une politique de data governance. Elle n'a pas de data governance. Cette leçon vous montre comment faire la différence à partir de trois signaux mesurables : lineage, stewardship et délai de traitement des demandes d'accès.

Pourquoi la gouvernance a besoin de métriques, pas de documents de politique

La data governance, c'est l'ensemble des règles, rôles et processus qui déterminent qui peut accéder aux données, les modifier, et en répondre. La plupart des organismes publics ont une charte de gouvernance. Beaucoup moins sont capables de produire des chiffres prouvant qu'elle fonctionne au quotidien.

Cet écart compte, parce que les données du secteur public alimentent des décisions à portée juridique : éligibilité aux prestations, avis d'imposition, activité policière, protection de l'enfance. Des données erronées ou sans responsable ne coûtent pas seulement de l'argent, elles produisent des refus injustifiés et des échecs d'audit. Le Government Accountability Office (GAO) américain a signalé à plusieurs reprises des agences fédérales pour data governance incomplète, notamment des inventaires de données incohérents dans le cadre de la Federal Data Strategy et de l'Evidence Act de l'OMB.

Trois métriques permettent d'auditer la gouvernance comme le ferait un observateur extérieur : le taux de couverture du lineage, le taux d'attribution du stewardship et le délai de traitement des demandes d'accès.

Métrique 1 : couverture du data lineage

Le data lineage est la trace documentée qui montre d'où provient une donnée, ce qui l'a transformée et où elle circule en aval, du système source au rapport puis au dashboard.

Pourquoi cela compte dans le secteur public : quand une agence Medicaid d'un État publie un taux d'erreur d'éligibilité, les auditeurs doivent remonter ce chiffre à travers chaque jointure, filtre et recodage jusqu'à l'enregistrement de demande d'origine. Sans lineage, impossible de répondre à « pourquoi ce chiffre semble faux » ou « qu'est-ce qui casse si on retire ce champ du mainframe historique ».

Comment la mesurer :

  • Taux de couverture du lineage = (nombre de datasets critiques dotés d'un lineage documenté et lisible par machine) / (nombre total de datasets critiques), exprimé en pourcentage.
  • Un dataset n'est « couvert » que si son lineage est stocké dans un outil de catalogue (pas une page wiki) et remonte au moins jusqu'au système de référence.

Les organisations data matures du privé visent souvent 80 à 90 % de couverture de lineage pour les datasets de tier 1 (réglementaires ou critiques pour la décision). Les organismes publics se situent fréquemment très en dessous ; les rapports du GAO et des inspecteurs généraux des agences fédérales citent couramment les lacunes de lineage et de métadonnées comme constat d'audit récurrent (estimation, sur la base des rapports répétés du GAO sur la gestion IT, pourcentages exacts non publiés de façon centralisée).

Exemple chiffré :

Une agence a 50 datasets classés « critiques » (utilisés dans les statistiques officielles ou les décisions de prestations). Un audit du catalogue révèle que 14 disposent d'un lineage complet documenté dans l'outil (par exemple Collibra, Alation, ou une option open source comme OpenMetadata).

Couverture du lineage = 14 / 50 = 28 %.

Voilà un programme de gouvernance qui existe sur le papier mais pas dans les faits. Une cible crédible de remédiation pour la première année : 60 % de couverture des datasets de tier 1.

Métrique 2 : attribution et activité du stewardship

Un data steward est une personne nommée (pas une équipe, pas un intitulé de poste, une personne réelle) responsable de la définition d'un dataset, de ses règles de qualité et des décisions d'accès. La santé du data stewardship mesure si le stewardship correspond à une responsabilité réelle ou à une case cochée dans un tableau RACI (Responsible, Accountable, Consulted, Informed, matrice de rôles courante en gouvernance).

Métriques clés :

  • Taux d'attribution du stewardship = datasets avec un steward nommé et à jour / total des datasets catalogués.
  • Réactivité du steward = temps médian pour qu'un steward résolve un problème de qualité de données signalé (par exemple un mapping de champ cassé, un type d'enregistrement en doublon).
  • Impact du turnover des stewards = nombre de datasets laissés « orphelins » (steward parti, rôle non réattribué sous 30 jours) par trimestre.

Un schéma d'échec classique : une agence désigne des stewards au lancement de la gouvernance, puis ne met jamais la liste à jour. Dix-huit mois plus tard, 40 % des stewards listés ont quitté l'agence. Le catalogue dit « propriétaire identifié ». La réalité dit « abandonné ».

Benchmark à appliquer : si votre taux d'orphelins dépasse 10 % des datasets critiques sur un trimestre, le stewardship est décoratif, pas fonctionnel. Ce seuil est une règle empirique issue de la pratique de la data governance, pas une norme réglementaire ; traitez-le comme un benchmark de travail plutôt que comme un chiffre de référence.

Métrique 3 : délai de traitement des demandes d'accès

C'est la métrique qui affecte le plus directement la délivrance du service et la confiance du public. Le délai de traitement des demandes d'accès mesure le temps écoulé entre une demande légitime d'accès aux données et l'accès effectivement provisionné.

Cela pèse énormément dans le secteur public en raison de régimes juridiques superposés :

  • Aux États-Unis, le Privacy Act de 1974 et les règles propres à chaque agence (comme FERPA pour les dossiers scolaires ou HIPAA pour les données de santé) déterminent qui peut accéder aux données personnelles et sous quelles garanties.
  • Dans l'UE, le Règlement général sur la protection des données (RGPD) exige une base légale documentée et souvent une analyse d'impact relative à la protection des données avant tout nouvel accès, sous le contrôle des autorités nationales de protection des données.

Un délai long n'est pas seulement de l'inefficacité, c'est un signal de gouvernance : cela signifie généralement que les workflows d'approbation d'accès sont manuels, non documentés, ou passent par des personnes qui ne comprennent plus le système.

Comment la mesurer :

  • Délai médian = nombre médian de jours calendaires entre la soumission de la demande et l'octroi de l'accès, suivi par niveau de sensibilité du dataset.
  • Segmentez par tier : les données publiques doivent être quasi immédiates (quelques heures) ; les données restreintes ou personnelles doivent avoir un SLA défini (service level agreement, délai de réponse cible convenu).

Exemple chiffré :

Une agence a enregistré 120 demandes d'accès à des datasets restreints le trimestre dernier. Délais triés en jours : la médiane (60e valeur du classement) est de 34 jours. Leur cible SLA publiée est de 10 jours ouvrés.

Taux de conformité = demandes traitées dans le SLA / total des demandes. Si seulement 22 des 120 ont respecté la cible de 10 jours, cela donne 18 % de conformité au SLA, un signal fort que le processus d'accès est cassé, quoi que promette le document de politique.

Vérification des acquis

1. Une agence d'État dispose d'une charte de data governance écrite et approuvée par la direction. Que manque-t-il, selon la leçon, si l'agence ne peut produire aucun chiffre mesurable sur le lineage, le stewardship et le délai d'accès ?

2. Un auditeur s'interroge sur un taux d'erreur d'éligibilité Medicaid qui semble anormal. Quelle métrique permet le plus directement de remonter ce chiffre à travers chaque transformation jusqu'à l'enregistrement source ?

3. Pourquoi la leçon considère-t-elle « six à huit semaines, parfois » comme la preuve d'un problème de gouvernance plutôt que comme un simple désagrément opérationnel ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les bonnes réponses expliquant pourquoi la data governance du secteur public comporte des enjeux plus élevés que dans beaucoup de contextes privés.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les bonnes réponses sur ce qui rend la couverture du lineage, le taux d'attribution du stewardship et le délai d'accès utiles comme métriques de gouvernance.

Sélectionnez toutes les réponses correctes.

Synthèse : un scorecard de santé de la gouvernance

Un audit utile ne traite pas ces trois métriques séparément. Combinez-les dans un scorecard simple, revu chaque trimestre :

MétriqueFormuleCible indicative (estimation, issue de la pratique)
Couverture du lineage (tier 1)datasets avec lineage documenté / datasets tier 1≥ 70 %
Attribution du stewardshipstewards nommés et à jour / datasets critiques≥ 90 %
Taux de datasets orphelinsdatasets orphelins / datasets critiques≤ 5 %
Conformité au SLA d'accèsdemandes dans le SLA / total des demandes≥ 85 %

Ces cibles ne proviennent pas d'une réglementation unique, elles reflètent des benchmarks de maturité en data governance couramment utilisés dans le public comme dans le privé. Prenez-les comme point de départ pour fixer vos objectifs internes, pas comme une exigence de conformité.

Une façon simple de calculer le scorecard par programme à partir d'un export du catalogue :

python
import pandas as pd

df = pd.read_csv("catalog_export.csv")
tier1 = df[df.tier == "critical"]

lineage_coverage = (tier1.has_lineage.sum() / len(tier1)) * 100
steward_rate = (tier1.has_current_steward.sum() / len(tier1)) * 100
orphan_rate = (tier1.steward_orphaned.sum() / len(tier1)) * 100

print(f"Lineage coverage: {lineage_coverage:.1f}%")
print(f"Stewardship assignment: {steward_rate:.1f}%")
print(f"Orphan rate: {orphan_rate:.1f}%")

Ce type de script, exécuté chaque trimestre sur les mêmes champs du catalogue, fait passer la gouvernance d'un récit (« nous prenons les données au sérieux ») à une courbe de tendance sur laquelle la direction peut agir.

Pour un modèle de référence plus approfondi, le DAMA-DMBOK (Data Management Body of Knowledge) est le framework praticien standard qui couvre en détail le stewardship, le lineage et la gestion des métadonnées.

Points clés

  • La data governance n'est réelle que si elle est mesurable : couverture du lineage, attribution du stewardship et délai d'accès sont les trois métriques de diagnostic centrales.
  • Une couverture de lineage inférieure à 50 % sur les datasets critiques rend les audits et le traçage d'erreurs lents ou impossibles ; visez 70 % et plus sur les données de tier 1 comme objectif de travail crédible.
  • Un taux de stewards orphelins supérieur à environ 10 % signale un stewardship qui n'existe que sur le papier, pas dans la responsabilité quotidienne.
  • La conformité au SLA des demandes d'accès est directement liée aux obligations légales (Privacy Act, RGPD) et à la confiance du public ; suivez-la par niveau de sensibilité des données, pas comme une moyenne globale.
  • Construisez un scorecard trimestriel à partir des métadonnées du catalogue plutôt qu'un rapport narratif : cela transforme les déclarations de gouvernance en une tendance auditable comme n'importe quelle autre métrique opérationnelle.