Cartographier le paysage des données publiques : registres, données administratives et données d'enquête
Une famille demande une aide au logement dans le comté de Cook, Illinois. Le travailleur social de l'agence du logement affiche trois chiffres : le revenu du ménage issu d'un document fiscal, sa taille et sa composition d'après une enquête du Census Bureau, et son historique d'expulsion issu d'un système de gestion des dossiers judiciaires. Les trois sources divergent sur presque tous les détails. Le document fiscal a un an. L'estimation de l'enquête porte sur un quartier, pas sur cette adresse. Le dossier judiciaire orthographie le nom de la famille de deux façons différentes. Le travailleur social doit décider, en temps réel, quel chiffre croire. Ce n'est pas un cas limite. C'est le quotidien du travail sur les données dans le secteur public, et c'est pourquoi comprendre le paysage des registres, des données administratives et des enquêtes compte plus que n'importe quel dashboard.
Les trois familles de données publiques
Les données du secteur public proviennent surtout de trois sources structurellement différentes, et les confondre est l'erreur analytique la plus courante du secteur.
Les registres sont des listes officielles, imposées par la loi : registres des naissances et des décès, registres des entreprises, registres fonciers (titres de propriété), listes électorales. Ils visent l'exhaustivité au sein d'une population légale et sont généralement tenus en continu.
Les données administratives sont le résidu du fonctionnement d'un programme : déclarations fiscales, dossiers de prestations sociales, systèmes d'inscription scolaire, dossiers d'admission hospitalière. Elles existent parce que quelqu'un devait traiter une transaction, pas parce que quelqu'un a conçu un jeu de données de recherche. Dans l'UE, elles sont de plus en plus reliées dans des cadres comme les lignes directrices sur les données administratives d'Eurostat, qui privilégient la réutilisation des données publiques existantes plutôt qu'une nouvelle collecte.
Les données d'enquête sont collectées en échantillonnant une population et en posant des questions, puis en pondérant les réponses pour représenter l'ensemble. L'American Community Survey (ACS) du US Census Bureau est l'exemple de référence : environ 3,5 millions de ménages échantillonnés chaque année (Census Bureau, méthodologie 2024) pour produire des estimations sur l'ensemble de la population américaine entre les recensements complets décennaux.
Chaque famille entretient un rapport différent à la vérité. Les registres prétendent être la vérité pour une catégorie juridique (qui possède cette parcelle). Les données administratives reflètent ce qui s'est passé dans une transaction précise (qui a reçu une prestation). Les enquêtes estiment un paramètre de population avec une marge d'erreur, par construction.
Pourquoi elles divergent, et comment arbitrer
Retour à l'agence du logement. Le document fiscal sous-estime les revenus informels ou issus du gig. L'estimation ACS est une moyenne modélisée pour un census tract (une petite unité géographique d'environ 1 200 à 8 000 personnes), pas pour ce ménage. Le dossier judiciaire peut refléter une expulsion résolue qui ne décrit plus le risque actuel.
La règle empirique que suivent travailleurs sociaux et analystes :
- Pour l'éligibilité (une décision juridique sur cette personne précise), les données administratives et les registres l'emportent. Ils sont ce qui se rapproche le plus de la réalité pour un dossier individuel, même imparfaitement.
- Pour la prévalence (combien de personnes, en général, sont dans une situation donnée), les données d'enquête l'emportent. Elles sont conçues pour généraliser, les données administratives non, car elles ne reflètent que les personnes ayant déjà interagi avec un système (un problème connu sous le nom de « sous-dénombrement administratif » ou, dans la recherche sur les prestations, de « take-up gap »).
- Pour les tendances et le ciblage (où le besoin augmente-t-il), triangulez. Superposer les estimations de pauvreté de l'ACS avec les données d'impayés de taxe foncière et les bases de requêtes d'expulsion (de nombreux tribunaux américains les publient ; voir l'Eviction Lab de Princeton) donne une image qu'aucune source seule ne fournit.
Les métriques de qualité des données réellement utilisées
Les équipes non techniques supposent souvent que « qualité des données » signifie « aucune erreur ». En pratique, les analystes du secteur public suivent une poignée de dimensions concrètes :
- Complétude : pourcentage de champs obligatoires renseignés. Un système de gestion de dossiers logement avec 15 % de numéros de sécurité sociale manquants a un problème de complétude qui bloque le rapprochement avec les données fiscales.
- Fraîcheur : délai entre un événement et son apparition dans le jeu de données. Aux États-Unis, les données de demandes d'assurance chômage sont quasi temps réel ; les estimations de pauvreté de l'ACS accusent environ un an de retard pour les estimations à 1 an (Census Bureau, cadence de publication standard).
- Couverture / sous-dénombrement : l'écart entre la population cible et ceux qui apparaissent effectivement dans la source. Le recensement américain de 2020 présentait un sous-dénombrement net estimé à environ 3,3 % pour la population noire et 4,9 % pour la population hispanique/latino (US Census Bureau, Post-Enumeration Survey, publication 2022, chiffres estimés par le Bureau avec marges d'erreur).
- Taux de rapprochement (match rate) : lorsqu'on relie deux sources (par exemple données fiscales et dossiers logement) par nom et date de naissance, quel pourcentage se relie avec succès. En dessous d'environ 85 à 90 %, les analystes doivent considérer le jeu de données rapproché comme biaisé, et pas seulement plus petit.
- Taux de doublons : une même entité apparaissant plusieurs fois sous des identifiants différents, problème chronique des registres sans identifiant national unique (les États-Unis n'ont pas d'identifiant national unique équivalent aux numéros personnels nordiques, ce qui complique le rapprochement des registres par rapport, par exemple, au système CPR danois).
Un exemple chiffré simple de taux de rapprochement :
Housing case files: 10,000 households
Successfully matched to tax records: 8,200
Match rate = 8,200 / 10,000 = 82%Un taux de rapprochement de 82 % signifie que 1 800 ménages sont invisibles pour toute analyse exigeant les deux jeux de données, et ces 18 % manquants sont rarement aléatoires. Ils penchent vers les locataires informels, les personnes ayant récemment déménagé et les résidents sans papiers, précisément la population que beaucoup de programmes de logement cherchent le plus à atteindre.
Gouvernance : qui a le droit de voir et de croiser quoi
La qualité des données n'est que la moitié de l'histoire. La gouvernance détermine si la triangulation est même légale.
Aux États-Unis, le Privacy Act de 1974 limite la façon dont les agences fédérales partagent entre systèmes des dossiers contenant des informations personnelles sans consentement ni exemption légale spécifique. Le Confidential Information Protection and Statistical Efficiency Act (CIPSEA), actualisé en 2018, encadre la manière dont les agences statistiques comme le Census Bureau peuvent (et, le plus souvent, ne peuvent pas) partager des données d'enquête identifiables avec d'autres agences, même pour de bonnes raisons comme la détection de fraude.
Dans l'UE, le Règlement général sur la protection des données (RGPD) fixe la base : les données personnelles ne peuvent être traitées que pour la finalité de leur collecte, sauf si une base légale spécifique (comme une mission d'intérêt public) justifie leur réutilisation. C'est pourquoi les offices statistiques européens s'appuient largement sur des rapprochements anonymisés et agrégés plutôt que sur des jointures au niveau individuel entre administrations.
Concrètement, cela signifie que l'agence du logement de notre exemple d'ouverture ne peut probablement pas simplement consulter la déclaration fiscale d'un individu auprès de l'IRS (Internal Revenue Service). Elle peut utiliser librement les estimations agrégées de l'ACS, demander des rapprochements de données administratives précises uniquement dans le cadre d'un accord de partage de données doté d'une base juridique définie, et doit documenter la base légale de chaque rapprochement, une piste d'audit que les régulateurs et les inspecteurs généraux finiront par vérifier.
Vérification des acquis
1. Qu'est-ce qui distingue fondamentalement un registre d'un jeu de données administratives ?
2. Pourquoi le document fiscal, l'estimation d'enquête et le dossier judiciaire divergeaient-ils dans l'exemple du comté de Cook ?
3. Un analyste doit estimer le nombre de ménages sous le seuil de pauvreté dans un census tract précis, mais il n'existe aucun registre complet des revenus. Quelle famille de données convient le mieux, et pourquoi ?
4. Sélectionnez TOUTES les réponses correctes à propos des données administratives comme source de données.
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les réponses correctes expliquant pourquoi un travailleur social doit décider « en temps réel » à quelle source se fier lorsque celles-ci divergent.
Sélectionnez toutes les réponses correctes.
Benchmarks à connaître
Quelques points de repère à retenir, tous signalés comme des estimations compte tenu de la méthodologie et de l'année de collecte :
- La marge d'erreur de l'ACS pour de petites géographies (un census tract) peut dépasser 20 à 30 % de l'estimation elle-même pour des caractéristiques peu fréquentes, ce qui signifie que les taux de pauvreté au niveau du tract doivent être traités comme une fourchette, pas comme un point.
- L'enquête EU Statistics on Income and Living Conditions (EU-SILC) d'Eurostat échantillonne environ 130 000 ménages dans les États membres chaque année (Eurostat, années d'enquête récentes), équivalent approximatif de l'ACS pour les indicateurs de pauvreté et de revenu dans l'UE.
- Un benchmark de rapprochement de données fréquemment cité : des taux de rapprochement supérieurs à 90 % sont considérés comme solides pour un rapprochement probabiliste (sans identifiant unique commun) en santé publique et dans les services sociaux ; en dessous de 70 %, le fichier rapproché ne devrait généralement pas servir à une inférenceinférenceLe moment où un modèle d'IA entraîné se met au travail : il reçoit une donnée nouvelle et produit une réponse, une prédiction ou un contenu.Voir la définition complète → au niveau de la population.
🎬 [VIDEO: "How the Census Bureau Protects Your Data" - youtube.com/@uscensusbureau - une courte explication officielle sur la confidentialité différentielle et les méthodes d'évitement de divulgation utilisées lors du recensement de 2020, utile pour comprendre pourquoi les comptages publiés sont délibérément bruités]
Points clés
- Les données du secteur public se répartissent en trois familles structurellement différentes : registres (exhaustivité juridique), données administratives (résidu de transactions) et enquêtes (estimations échantillonnées avec marges d'erreur). Sachez laquelle vous utilisez avant de croire un chiffre.
- Pour les décisions d'éligibilité individuelle, faites confiance aux données administratives et aux registres. Pour les estimations de prévalence et de tendance au niveau de la population, faites confiance aux enquêtes. Triangulez pour les décisions de ciblage.
- Suivez la complétude, la fraîcheur, la couverturecouvertureLe nombre de personnes uniques exposées à votre message sur une période donnée. Contrairement aux impressions, le reach compte chaque personne une seule fois, quel que soit le nombre d'expositions.Voir la définition complète →/sous-dénombrement, le taux de rapprochement et le taux de doublons comme métriques de qualité concrètes et calculables, plutôt que des notions vagues de « données propres ».
- Les règles de gouvernance (Privacy Act et CIPSEA aux États-Unis, RGPDRGPDRèglement de l'UE encadrant la collecte, le stockage et l'usage des données personnelles, avec des amendes indexées sur le chiffre d'affaires mondial.Voir la définition complète → dans l'UE) limitent souvent le rapprochement avant même que la qualité des données devienne le facteur limitant. La base légale d'une jointure est un prérequis, pas un détail traité après coup.
- Un taux de rapprochement inférieur à environ 70 à 85 % lors du croisement de jeux de données signale généralement un biais systématique dans les exclus, et pas seulement un échantillon plus petit.
Articles liés
Les articles récents du blog qui s'appuient sur cette leçon.
- DataQuand deux agences ne parlent pas le même langage de données, c'est le citoyen qui paie le prixL'interopérabilité entre agences publiques n'est pas une question technique secondaire : c'est la condition sine qua non pour que des politiques sociales, sanitaires ou fiscales puissent reposer sur des données fiables et partagées. Cet article explique comment les standards de données partagés fonctionnent concrètement, pourquoi leur absence coûte cher, et où les arbitrages sont vraiment difficiles.
- DataPublier des données ouvertes que les citoyens, journalistes et corps de contrôle utilisent vraimentLa plupart des portails open data publics accumulent des fichiers que personne ne télécharge. Ce guide pratique montre comment un CDO du secteur public passe d'une conformité formelle à une publication qui génère un usage réel.