Interopérabilité et standards partagés entre administrations
Dans un service départemental de protection de l'enfance, un travailleur social signale un risque d'absentéisme chronique pour un enfant de 9 ans. Le système de suivi des présences du district scolaire détient la donnée. L'agence de protection de l'enfance détient le dossier. Les deux enregistrements décrivent le même enfant. Aucun des deux systèmes ne le sait.
Pourquoi ? Le district scolaire identifie l'élève par un identifiant éducatif d'État. L'agence l'identifie par un numéro de dossier rattaché à une orthographe différente du nom, utilisée par son tuteur lors de l'admission. Aucune clé commune ne relie les deux enregistrements. Multipliez cela par chaque école, hôpital, tribunal et office du logement qu'une famille vulnérable croise, et vous obtenez le problème de données caractéristique du secteur public : des données riches enfermées dans des silos incompatibles.
Cette leçon couvre les standards d'identifiants et de schémas qui résolvent ce problème, les métriques de gouvernance qui suivent la santé de l'interopérabilité, et les benchmarks utilisés pour juger si un effort de partage de données fonctionne réellement.
Pourquoi les silos existent par conception, pas par accident
Les systèmes publics ont été construits agence par agence, souvent à des décennies d'intervalle, financés par des flux de subventions différents assortis de règles différentes.
- FERPA (Family Educational Rights and Privacy Act) restreint le partage des dossiers scolaires aux États-Unis.
- HIPAAHIPAAHealth Insurance Portability and Accountability Act, loi américaine imposant la protection des données de santé (PHI). Violations : amendes jusqu'à 1,9M$ par catégorie de violation. (Health Insurance Portability and Accountability Act) encadre les données de santé.
- 42 CFR Part 2 ajoute des restrictions supplémentaires sur les dossiers de traitement des addictions.
Chaque loi a été écrite pour protéger un type de donnée sensible, sans pont technique ou juridique commun entre les systèmes. Résultat : des silos imposés par la loi, antérieurs à toute discussion sur l'interopérabilité des données.
C'est important pour la fluency. Quand vous entendez « nos systèmes ne peuvent pas communiquer » dans une administration, il s'agit rarement de pure incompétence. C'est en général un mélange de contrainte juridique, d'IT legacy et de standards absents.
La brique de base : les identifiants
Vous ne pouvez pas joindre deux jeux de données portant sur la même personne, le même lieu ou le même dossier sans identifiant partagé ou méthode de rapprochement fiable.
Le matching déterministe joint les enregistrements sur une clé commune exacte (un numéro de sécurité sociale, un identifiant élève d'État, un National Provider Identifier pour les cliniciens). Rapide et précis, mais ne fonctionne que si la clé est renseignée de façon cohérente et correcte, ce qui en pratique est rarement le cas.
Le matching probabiliste (aussi appelé fuzzy matching ou record linkage) note la similarité sur plusieurs champs (nom, date de naissance, adresse, téléphone) quand aucune clé commune n'existe. Il produit un score de confiance de rapprochement plutôt qu'une certitude. C'est la technique de référence pour connecter des dossiers sociaux, de santé et scolaires entre administrations qui ne se sont jamais accordées sur un identifiant commun.
Une illustration simplifiée de la construction d'un score de matching :
match_score = (
0.4 * name_similarity # ex. : distance de chaînes Jaro-Winkler
+ 0.3 * dob_exact_match # 1 si identique, 0 sinon
+ 0.2 * address_similarity
+ 0.1 * phone_match
)
# Seuil : match_score > 0.85 = lien automatique
# 0.6-0.85 = à revoir par un humain
# < 0.6 = pas de lienDes structures comme le réseau Actionable Intelligence for Social Policy (AISP) de l'Université de Pennsylvanie publient des boîtes à outils ouvertes sur la construction responsable de ces « integrated data systems » inter-agences.
Standards de schémamaUtiliser un logiciel pour automatiser les tâches et campagnes marketing répétitives, afin de personnaliser à grande échelle sur des canaux comme l'email, le web et le social.Voir la définition complète → : parler le même langage de données
Même avec un identifiant rapproché, deux systèmes doivent décrire le *contenu* de la même façon. C'est le rôle des standards de schéma et d'échange.
Les standards clés à connaître :
- HL7 FHIR (Fast Healthcare Interoperability Resources) : le standard dominant pour l'échange de données de santé entre hôpitaux, assureurs et agences de santé publique. Imposé par la réglementation fédérale américaine issue de l'Office of the National Coordinator for Health IT (ONC).
- NIEM (National Information Exchange Model) : un schéma fédéral américain de partage de données utilisé dans la justice, la gestion de crise et les services sociaux, pour qu'un enregistrement « personne » ou « incident » ait le même sens partout où il est utilisé.
- Ed-Fi : un standard de données largement adopté par les agences éducatives des États américains pour normaliser les dossiers élèves, cours et présences.
- X-Road : la couche d'échange de données estonienne, sans doute l'exemple le plus cité au monde d'infrastructure nationale d'interopérabilité, qui connecte la quasi-totalité des services publics en ligne depuis le début des années 2000. Référencé par les ressources d'interopérabilité de la Commission européenne.
- SDMX (Statistical Data and MetadataMetadataDonnées sur les données, informations décrivant le contexte, la structure, la provenance et les caractéristiques d'un asset de données (auteur, date, format, source, définition). eXchange) : utilisé par Eurostat, l'OCDE et les instituts nationaux de statistique pour échanger des séries statistiques comparables entre pays.
Le schéma commun à tous : un schéma partagé transforme un *transfert* de données en une *intégration* de données. Sans lui, les administrations échangent des fichiers qui exigent un re-mapping manuel à chaque fois, ce qui est coûteux, lent et source d'erreurs.
Les métriques de gouvernance qui suivent la santé de l'interopérabilité
Une fois qu'un pipelinepipelineL'ensemble des opportunités commerciales actives réparties selon les étapes du processus de vente, avec leur valeur potentielle cumulée et leur probabilité de conclusion.Voir la définition complète → de partage de données existe, il faut des métriques pour savoir s'il fonctionne. Les principales utilisées en gouvernance des données publiques :
| Métrique | Ce qu'elle mesure | Pourquoi c'est important |
|---|---|---|
| Taux de matching | % d'enregistrements reliés avec succès entre systèmes | Un taux faible signifie que les silos persistent malgré l'existence du pipeline |
| Taux de faux positifs | % de rapprochements ensuite jugés incorrects | Relier à tort les dossiers social et scolaire de deux enfants différents est un préjudice sérieux, pas juste du bruit |
| Latence des données | Délai entre un événement et sa disponibilité dans le système partagé | Un signalement d'absentéisme qui arrive 3 mois plus tard est inutile pour la prévention |
| Complétude des champs | % de champs obligatoires renseignés (ex. : date de naissance, adresse) | Les algorithmes de matching échouent silencieusement sur les champs manquants |
| CouvertureCouvertureLe nombre de personnes uniques exposées à votre message sur une période donnée. Contrairement aux impressions, le reach compte chaque personne une seule fois, quel que soit le nombre d'expositions.Voir la définition complète → consentement/autorisation | % de cas de partage avec base légale documentée | Exigé par FERPA, HIPAA et la plupart des régimes européens de protection des données |
Sous le RGPDRGPDRèglement de l'UE encadrant la collecte, le stockage et l'usage des données personnelles, avec des amendes indexées sur le chiffre d'affaires mondial.Voir la définition complète → européen (Règlement général sur la protection des données), le partage inter-administrations doit documenter une base légale (article 6) et, pour les données de catégorie particulière comme la santé ou le statut social, une condition supplémentaire au titre de l'article 9. Les dashboards de gouvernance dans les organismes publics européens suivent en général « base légale documentée » comme métrique de conformité, à côté des taux de matching techniques.
Un exemple chiffré : si un integrated data system départemental tente de relier 10 000 dossiers de protection de l'enfance à une base de données éducative d'État et en rapproche 7 400 avec succès, le taux de matching est de 74 %. Si un audit ultérieur révèle que 220 de ces rapprochements étaient incorrects (mauvais enfant), le taux de faux positifs est d'environ 3 % (220/7 400). Les deux chiffres doivent être publiés ensemble. Un taux de matching élevé avec un taux d'erreur élevé caché est pire qu'un taux de matching modeste auquel vous pouvez vous fier.
Vérification des acquis
1. Dans l'exemple de la protection de l'enfance, pourquoi les dossiers du district scolaire et de l'agence sociale ne se relient-ils pas automatiquement alors qu'ils décrivent le même enfant ?
2. Selon la leçon, quelle est la raison principale de l'existence des silos de données entre administrations ?
3. Pourquoi l'identifiant partagé est-il considéré comme la « brique de base » de l'interopérabilité entre jeux de données administratifs ?
4. Sélectionnez TOUTES les réponses correctes concernant les lois qui contribuent aux silos de données imposés par la loi dans le secteur public américain.
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les réponses correctes expliquant pourquoi l'on entend souvent « nos systèmes ne peuvent pas communiquer » dans les administrations.
Sélectionnez toutes les réponses correctes.
Benchmarks : à quoi ressemble le « bon » niveau
Il n'existe pas de benchmark mondial unique pour l'interopérabilité, mais des points de repère aident à calibrer les attentes.
- Le modèle X-Road estonien est fréquemment cité (OCDE, Commission européenne) comme permettant à la plupart des vérifications de données entre administrations de se faire automatiquement, sans qu'un citoyen resoumette deux fois la même information, une approche appelée « once-only principle ».
- Aux États-Unis, le réseau AISP Integrated Data Systems indique que les systèmes intégrés matures à l'échelle départementale (reliant données sociales, judiciaires, éducatives et de santé) rapportent couramment des taux de matching probabiliste entre 70 et 90 %, même si les chiffres exacts varient fortement selon le comté et la qualité des données (c'est une estimation générale, pas un standard fixe).
- Le règlement européen sur l'Europe interopérable (Interoperable Europe Act, entré en vigueur en 2024) instaure un cadre exigeant des administrations publiques de l'UE qu'elles évaluent l'impact sur l'interopérabilité avant de déployer de nouveaux systèmes, un signal réglementaire important : on passe de la bonne pratique à l'obligation.
Pour évaluer l'affirmation d'interopérabilité d'une administration, posez trois questions de fluency :
- Quel identifiant ou quelle méthode de rapprochement sous-tend la jointure ?
- Quels sont le taux de matching et le taux d'erreur documentés, au-delà du « nous partageons nos données désormais » ?
- Quelle est la base légale, et qui l'audite ?
What is Interoperability in Healthcare?
Points clés à retenir
- Les jointures de données inter-administrations échouent principalement pour deux raisons : pas d'identifiant partagé et pas de schéma partagé, à quoi s'ajoutent les restrictions juridiques comme FERPA, HIPAA et 42 CFR Part 2 aux États-Unis, ou les exigences de base légale du RGPD dans l'UE.
- Le record linkage probabiliste (fuzzy matching sur nom, date de naissance, adresse) est le contournement pratique quand les administrations n'ont pas d'identifiant commun ; il produit un score de confiance, pas une certitude, et exige une revue humaine aux marges.
- Les standards de schéma (HL7 FHIR pour la santé, NIEM pour la justice et les services sociaux, Ed-Fi pour l'éducation, X-Road et SDMX à l'international) permettent aux systèmes de s'accorder sur ce qu'un champ de données *signifie*, et pas seulement sur la façon de le transmettre.
- Suivez l'interopérabilité avec des métriques appariées : taux de matching avec taux de faux positifs, plus latence des données et couverture des consentements. Un taux de matching élevé sans taux d'erreur associé doit être traité comme une affirmation incomplète.
- La dynamique réglementaire (Interoperable Europe Act dans l'UE, obligations FHIR fédérales via l'ONC aux États-Unis) fait passer l'interopérabilité de la bonne pratique volontaire à l'obligation de conformité : c'est de plus en plus un sujet d'audit et de gouvernance, pas seulement d'IT.
Articles liés
Les articles récents du blog qui s'appuient sur cette leçon.