Les dimensions de la qualité des données : pourquoi le « suffisamment bon » détruit la confiance

IBM a estimé, dans une évaluation devenue célèbre, que la mauvaise qualité des données coûte 3 100 milliards de dollars par an à l'économie américaine. Gartner chiffre le coût moyen pour une organisation à 12,9 millions de dollars par an.
Ces chiffres restent abstraits jusqu'à ce qu'on relie des coûts précis à des défaillances précises de qualité des données : une banque qui envoie des offres de prêt à des clients décédés. Un industriel qui expédie des produits à de mauvaises adresses à cause de codes postaux en doublon. Un hôpital qui administre un dosage erroné à cause d'une erreur de conversion d'unité dans le système EHR. Une prévision de demande d'un distributeur fausse de 40 % parce que l'historique des ventes incluait les retours.
La qualité des données n'est pas un sujet technique. C'est un risque business avec un prix mesurable.
Les six dimensions de la qualité des données
Le DAMA-DMBOKDAMA-DMBOKData Management Body of Knowledge, référentiel de l'association DAMA définissant les 11 domaines de gestion des données (gouvernance, qualité, architecture, sécurité, etc.). définit six dimensions de la qualité des données. Tout problème de qualité renvoie à au moins l'une d'entre elles :
1. Exactitude, la donnée représente-t-elle correctement l'entité ou l'événement réel qu'elle décrit ? L'adresse d'un client est exacte si elle correspond à son adresse réelle. Défaillances d'exactitude : « Paris » saisi « Parsi » à cause d'une faute de frappe ; montants de transaction mal arrondis ; poids produit enregistré dans la mauvaise unité.
2. Complétude, tous les éléments de données requis sont-ils présents ? Une fiche client sans adresse e-mail est incomplète si l'e-mail est requis par le processus métier. Les défaillances de complétude sont souvent systémiques : champs optionnels qui devraient être obligatoires, intégrations APIAPIApplication Programming Interface : une interface standardisée qui permet aux applications de communiquer et d'échanger des données sans connaître leur fonctionnement interne respectif.Voir la définition complète → qui perdent des champs, scripts de migration qui ne transfèrent pas tous les attributs.
3. Cohérence, la même donnée est-elle représentée de la même manière dans tous les systèmes ? Une date de naissance enregistrée en JJ/MM/AAAA dans le CRMCRMCustomer Relationship Management : logiciel et stratégie pour gérer et analyser les interactions clients tout au long de leur cycle de vie.Voir la définition complète → mais en MM/JJ/AAAA dans le système de facturation est une incohérence. Les défaillances de cohérence sont la première cause des débats « quel système a raison ? ».
4. Fraîcheur, la donnée est-elle disponible au moment où on en a besoin, et reflète-t-elle l'état actuel ? Un score de crcrLe pourcentage de visiteurs ou de prospects qui réalisent une action attendue (achat, inscription, formulaire de contact), calculé en divisant les conversions par le nombre total d'opportunités.Voir la définition complète →édit mis à jour tous les mois est suffisamment frais pour une revue annuelle de crédit immobilier, pas pour une décision de prêt en temps réel. Ces défaillances apparaissent souvent sous la forme « on savait, mais la donnée n'avait pas encore été rafraîchie ».
5. Validité, la donnée respecte-t-elle les formats, plages de valeurs et règles métier définis ? Un numéro de téléphone à 11 chiffres dans un champ défini pour 10 est invalide. Une date de transaction dans le futur est invalide. Les défaillances de validité sont les plus faciles à détecter et corriger au point de saisie.
6. Unicité, chaque entité réelle est-elle représentée exactement une fois ? Les fiches clients en doublon sont une défaillance d'unicité. La déduplication est l'une des initiatives de qualité des données les plus courantes, et l'une de celles dont on sous-estime le plus la complexité.
Data Quality Management | DAMA DMBOK Chapter 13 Explained
Vérification des acquis
1. La date de naissance d'un client est stockée en JJ/MM/AAAA dans le CRM et en MM/JJ/AAAA dans le système de facturation. Quelle dimension de la qualité des données est principalement en cause ?
2. Un prêteur utilise le score de crédit d'un client pour des décisions de prêt en temps réel, mais ce score n'est rafraîchi que mensuellement. Quelle dimension de la qualité des données est la plus menacée ?
3. Quel est le message central derrière le fait de chiffrer la mauvaise qualité des données en coût pour l'économie et pour les organisations ?
4. Sélectionnez TOUS les scénarios qui constituent des défaillances de VALIDITÉ (donnée non conforme aux formats, plages de valeurs ou règles métier définis).
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les affirmations qui décrivent correctement le lien entre les six dimensions du DAMA-DMBOK et les problèmes de qualité des données.
Sélectionnez toutes les réponses correctes.
Mesurer la qualité des données : du subjectif au quantitatif
« Notre qualité de données est plutôt bonne » n'est pas une mesure. « Nos données de référence clients sont complètes à 94 %, exactes à 87 % et cohérentes à 91 % entre le CRM et la facturation » en est une.
Scoring de qualité des données : pour chaque domaine de données, définissez un score de qualité comme moyenne pondérée des six dimensions. Pondérez les dimensions selon leur importance business. Pour des données clients utilisées en marketing, la complétude et l'exactitude des coordonnées peuvent peser lourd. Pour des données financières utilisées en reporting, ce sont la cohérence et la fraîcheur qui comptent le plus.
Profiling : avant de scorer, il faut profiler. Les outils de data profiling (Great Expectations, Informatica Data QualityData QualityLe degré d'aptitude des données à l'usage prévu : exactes, complètes, cohérentes, à jour, valides et uniques. Une data quality faible fragilise l'analytics, le reporting et l'IA.Voir la définition complète →, Ataccama) analysent les jeux de données pour révéler : taux de valeurs nulles, distributions de valeurs, violations de format, taux de doublons, défauts d'intégrité référentielle. Profiler un nouveau jeu de données pour la première fois est presque toujours révélateur, et souvent alarmant.
Dashboards de qualité : le CDO doit disposer d'un dashboard de qualité des données en temps réel montrant les scores par domaine et leur évolution. Ce dashboard doit être partagé avec les data owners de chaque domaine : rendre la qualité visible est le premier pas pour la rendre redevable.
Le business case de l'investissement en qualité des données
Le calcul de ROIROIReturn on Investment : le rapport entre le profit net et le coût d'un investissement. Un ROI de 300 % signifie que chaque dollar investi en rapporte 3.Voir la définition complète → de la qualité des données est simple :
Coût actuel de la mauvaise qualité : quantifiez au moins un coût mesurable, temps de reprise, corrections d'erreurs, réclamations clients, amendes réglementaires, opportunités manquées faute de données complètes.
Coût de l'initiative qualité : licences d'outils + implémentation + stewardship continu + profiling et monitoring.
État cible : quel score de qualité allez-vous atteindre, et quel résultat business cela permet-il ?
Un opérateur télécom européen a calculé que 12 % de son budget marketing était gaspillé à cibler des clients inactifs à cause d'une complétude et d'une exactitude insuffisantes. Une initiative qualité de 50 KKLe nombre moyen de nouveaux utilisateurs que chaque utilisateur existant génère par recommandation. Au-dessus de 1,0, la croissance s'auto-alimente et devient exponentielle.Voir la définition complète →€ ayant réduit ce gaspillage de 50 % a généré 3 M€ d'économies annuelles sur un budget marketing de 25 M€, soit un ROI de 60x. C'est le langage que les CFO comprennent.
À faire, tiré de cette leçon
Ces actions sont compilées dans le plan d'action du rôle.
- Profiler les datasets et publier des dashboards de qualité en temps réel par domaine
Articles liés
Les articles récents du blog qui s'appuient sur cette leçon.
- DataLes détecteurs de "AI slop" dégradent vos modèles de sentiment, et le CDO doit choisir son campFiltrer les données générées par IA dans un corpus d'entraînement semble relever du bon sens. Une expérience publiée par Towards Data Science en 2026 montre que cette logique produit l'effet inverse : les détecteurs confondent des avis humains authentiques avec du contenu synthétique, et leur application rend le modèle final moins précis. Le CDO qui s'arrête à "détecter et supprimer" rate la vraie question sur la qualité des données.
- DataComment Mastercard a fait tenir son MDM dans la duréeMastercard a reconfiguré sa gestion des données de référence après des années de silos qui coûtaient cher en réconciliations manuelles et en décisions ralenties. Ce que l'entreprise a fait, et ce que les CDO peuvent en retenir sans reproduire un contexte qu'ils n'ont pas.
- DataData observability : intercepter les données défaillantes avant qu'elles n'influencent vos décisionsLes pipelines de données silencieux cassent sans prévenir, et les décisions prises sur des données corrompues coûtent bien plus que le coût de détection. Ce playbook donne aux CDO une séquence concrète pour déployer l'observabilité des données et arrêter les incidents avant qu'ils n'atteignent les tableaux de bord et les modèles.