+150 XP

Scorecards de qualité des données pour les jeux de données publics

Un gestionnaire de dossiers dans un bureau Medicaid d'un État américain sort un rapport : 40 000 ménages signalés comme « au-dessus du plafond de revenus » pour le renouvellement de leurs prestations. Avant que quiconque envoie un avis de radiation, il faudrait poser la question : combien de ces 40 000 lignes comportent des adresses obsolètes, des champs de revenus manquants ou des identifiants de dossier en doublon issus d'une migration de système d'il y a trois ans ? En 2023, plusieurs États américains ont purgé leurs listes Medicaid via des contrôles d'éligibilité automatisés après la fin des protections liées à la pandémie, et des enquêtes journalistiques (voir le suivi du Medicaid unwinding par KFF) ont montré que de nombreuses radiations étaient dues à des erreurs administratives et de données, pas à une réelle perte d'éligibilité. C'est une défaillance de qualité des données avec des conséquences humaines concrètes.

Cette leçon construit un outil pratique pour ce moment précis : une scorecard qui vous dit si un jeu de données public est suffisamment fiable pour agir dessus.

Pourquoi la qualité des données est un sujet de gouvernance, pas seulement un sujet IT

Dans le secteur public, les défaillances de qualité des données ne coûtent pas seulement de l'argent. Elles peuvent priver quelqu'un d'une prestation, mal orienter des ressources d'urgence, ou produire une politique publique bâtie sur une fiction.

La qualité des données désigne le fait qu'un jeu de données soit adapté à l'usage prévu. On l'évalue généralement selon quatre à six dimensions. Nous nous concentrerons sur les quatre les plus actionnables pour les analystes du secteur public :

  • Complétude : les champs requis sont-ils renseignés ?
  • Exactitude : les données reflètent-elles la réalité ?
  • Fraîcheur : les données sont-elles assez récentes pour être pertinentes ?
  • Cohérence : les données sont-elles en accord avec elles-mêmes et avec les autres systèmes ?

Ces dimensions recoupent étroitement le framework utilisé par le US Government Accountability Office (GAO), l'agence d'audit fédérale, dans ses évaluations de fiabilité des données pour les audits de programmes.

Construire la scorecard : un fichier d'éligibilité aux prestations

Imaginez le fichier d'éligibilité au Supplemental Nutrition Assistance Program (SNAP, le programme fédéral américain d'aide alimentaire) d'un État : 100 000 lignes, une ligne par ménage, utilisé pour décider qui est renouvelé automatiquement.

Dimension 1 : Complétude

Pourcentage de champs requis non nuls sur les variables critiques (revenus, taille du ménage, adresse, date de dernière vérification).

Exemple chiffré :

  • Champ revenus renseigné : 96 000 / 100 000 = 96 %
  • Taille du ménage renseignée : 99 500 / 100 000 = 99,5 %
  • Date de dernière vérification renseignée : 88 000 / 100 000 = 88 %

Score de complétude = moyenne des champs critiques = (96 + 99,5 + 88) / 3 = 94,5 %

Un benchmark courant dans le secteur public : les champs utilisés directement dans la détermination d'éligibilité doivent dépasser 98 % de complétude avant qu'une décision automatisée s'appuie dessus. En dessous, on signale pour revue manuelle.

Dimension 2 : Exactitude

Plus difficile à mesurer directement ; on l'estime généralement par un audit sur échantillon face à une source de vérité (bulletins de paie, données employeurs, croisement avec des bases de salaires).

Exemple chiffré : les auditeurs tirent un échantillon aléatoire de 500 dossiers et vérifient les revenus dans le système de déclaration des salaires de l'État.

  • Dossiers concordants dans une tolérance raisonnable : 465 / 500 = taux d'exactitude de 93 %

Pour des données d'éligibilité à fort enjeu, de nombreuses normes d'audit (dans le sillage des recommandations du GAO) considèrent tout niveau inférieur à 95 % d'exactitude comme insuffisamment fiable pour des actions défavorables automatisées (refus, radiations) sans revue humaine.

Dimension 3 : Fraîcheur

À quel point les données sont-elles récentes par rapport au moment où on les utilise ?

Exemple chiffré : les ménages sont censés être re-vérifiés tous les 12 mois.

  • Vérifiés au cours des 12 derniers mois : 82 000 / 100 000 = 82 % à jour
  • 18 000 dossiers ont une date de vérification de plus de 12 mois, ce qui signifie que les changements de revenus ou de composition du ménage peuvent ne pas être reflétés.

Dimension 4 : Cohérence

Les valeurs concordent-elles entre les systèmes ou au sein du fichier ? Contrôle courant : la taille du ménage dans le système d'éligibilité correspond-elle à celle du système fiscal ou salarial associé ?

Exemple chiffré :

  • Taux de concordance inter-systèmes : 91 000 / 100 000 = 91 % de cohérence
  • Les 9 % d'écarts peuvent refléter de vrais changements de ménage (une naissance, un déménagement) ou un échec de synchronisation entre deux systèmes IT, problème fréquent quand des mainframes legacy alimentent un logiciel de gestion de dossiers plus récent.

Assembler la scorecard

DimensionScoreSeuil pour décisions automatiséesRéussite/Échec
Complétude94,5 %98 %Échec
Exactitude93 %95 %Échec
Fraîcheur82 %90 %Échec
Cohérence91 %95 %Échec

Verdict global : ce jeu de données échoue sur trois dimensions sur quatre face à des seuils raisonnables pour une action automatisée à fort enjeu. Il peut rester utilisable pour de l'analyse de politique publique agrégée (estimer les tendances de charge de dossiers) mais ne devrait pas piloter des décisions individuelles de radiation sans une couche de revue human-in-the-loop.

C'est le jugement central de cette leçon : le même jeu de données peut être « suffisamment bon » pour un usage et dangereux pour un autre. Une scorecard ne vous donne pas un verdict unique, elle vous donne un verdict spécifique à un cas d'usage.

Un snippet de scoring simple

python
import pandas as pd

def completeness(df, cols):
    return df[cols].notna().mean().mean() * 100

def timeliness(df, date_col, months_allowed=12, as_of=pd.Timestamp("2026-01-01")):
    cutoff = as_of - pd.DateOffset(months=months_allowed)
    return (df[date_col] >= cutoff).mean() * 100

critical_fields = ["income", "household_size", "last_verified"]
score_completeness = completeness(df, critical_fields)
score_timeliness = timeliness(df, "last_verified")

print(f"Completeness: {score_completeness:.1f}%")
print(f"Timeliness: {score_timeliness:.1f}%")

Lancez ça chaque mois, tracez la tendance, et vous détectez la dégradation avant qu'elle ne devienne un scandale.

Vérification des acquis

1. Dans l'exemple du Medicaid unwinding, pourquoi parle-t-on d'une défaillance de qualité des données plutôt que d'un simple résultat de politique publique ?

2. Un gestionnaire de dossiers constate que le champ revenus d'un ménage est renseigné mais correspond à un emploi que la personne a quitté il y a deux ans. Quelle dimension de qualité des données est la plus directement enfreinte ?

3. Pourquoi la leçon présente-t-elle la qualité des données comme un sujet de gouvernance plutôt que purement IT ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les réponses correctes concernant les quatre dimensions clés de qualité des données décrites dans la leçon.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les réponses correctes expliquant pourquoi un analyste devrait construire une scorecard de qualité des données avant d'agir sur un jeu de données public comme un fichier d'éligibilité aux prestations.

Sélectionnez toutes les réponses correctes.

Gouvernance : qui est propriétaire des seuils ?

Les seuils (98 % de complétude, 95 % d'exactitude, etc.) ne sont pas des lois universelles, ce sont des choix politiques, et quelqu'un doit en être propriétaire.

Aux États-Unis, les agences formalisent de plus en plus cela via des data governance boards, sous l'influence du Foundations for Evidence-Based Policymaking Act (2018), qui impose aux agences fédérales de nommer des Chief Data Officers et de constituer des inventaires de données et des plans qualité. La Federal Data Strategy de l'OMB fixe les attentes en matière de pratiques de qualité des données à l'échelle des agences.

Dans l'UE, le Data Governance Act (2022) et les lois nationales sur l'open data poussent les organismes publics vers des standards de qualité des données documentés, en particulier pour les jeux de données partagés en vue d'une réutilisation. Eurostat, l'office statistique de l'UE, publie son propre framework d'assurance qualité avec des dimensions quasi identiques aux quatre ci-dessus, plus la « cohérence » et l'« accessibilité ».

La leçon pratique : avant de faire confiance à une scorecard, demandez qui a fixé les seuils de réussite/échec, et s'ils ont été calibrés pour la décision en jeu (une radiation de prestations) plutôt que pour une décision à moindre enjeu (un dashboard public).

Quand « suffisamment bon » ne l'est pas

Un jeu de données peut passer tous les seuils techniques et vous induire en erreur s'il est biaisé systématiquement : par exemple, si les campagnes de contact et de re-vérification sont plus fréquentes dans les comtés urbains mieux couverts en haut débit, les ménages ruraux afficheront des scores de fraîcheur artificiellement mauvais, qui reflètent des écarts d'infrastructure, pas le comportement des ménages. Associez toujours la scorecard à une ventilation par sous-groupe (région, langue, âge) avant de l'utiliser pour une politique publique.

🎬 [VIDEO: "Data Quality Dimensions Explained" - https://www.youtube.com/results?search_query=data+quality+dimensions+explained - résultats de recherche de vidéos explicatives accessibles couvrant les frameworks de complétude, exactitude, fraîcheur et cohérence utilisés dans les secteurs public et privé]

Points clés

  • Une scorecard de qualité des données doit mesurer au minimum quatre dimensions : complétude, exactitude, fraîcheur, cohérence, chacune avec un pourcentage concret et un seuil explicite lié à la décision prise.
  • Le même jeu de données peut convenir à une analyse agrégée et être inadapté à des décisions individuelles à fort enjeu comme des radiations de prestations ; cadrez toujours votre verdict par cas d'usage.
  • Les seuils sont des choix politiques, pas des lois naturelles. Aux États-Unis, l'Evidence-Based Policymaking Act et la Federal Data Strategy de l'OMB poussent les agences vers des plans qualité formalisés ; dans l'UE, le Data Governance Act et le framework qualité d'Eurostat jouent un rôle similaire.
  • Passer les seuils techniques n'exclut pas un biais systémique. Ventilez toujours les scores par sous-groupe (région, démographie, canal) avant de faire confiance à un score agrégé.
  • Construisez les scorecards comme des contrôles récurrents et automatisés, pas comme des audits ponctuels, pour que la dégradation soit détectée avant de piloter une décision politique erronée.

Articles liés

Les articles récents du blog qui s'appuient sur cette leçon.