Data quality
Aussi : DQ, Data Quality, Information quality, Qualite des donnees
Le degré d'aptitude des données à l'usage prévu : exactes, complètes, cohérentes, à jour, valides et uniques. Une data quality faible fragilise l'analytics, le reporting et l'IA.
De quoi il s'agit
La data quality mesure à quel point un jeu de données sert l'usage auquel il est destiné. Ce n'est pas un idéal abstrait mais un jugement relatif à un usage précis : des données suffisantes pour une segmentation marketing peuvent être inutilisables pour du reporting financier. La qualité se décompose généralement en six dimensions largement admises :
- Exactitude : les valeurs décrivent correctement le réel (l'adresse d'un client est bien son adresse).
- Complétude : les champs et enregistrements requis sont présents (aucune ligne de chiffre d'affaires manquante).
- Cohérence : les valeurs concordent entre systèmes (un même client a le même statut dans le CRM et la facturation).
- Fraîcheur : les données sont assez récentes pour la décision (le stock d'hier, pas celui du mois dernier).
- Validité : les valeurs respectent les règles et formats définis (une date est une vraie date, un code pays existe).
- Unicité : pas de doublons involontaires (un enregistrement par client, pas trois).
Pourquoi c'est important
Chaque usage en aval hérite de la qualité de ses entrées. Dashboards, déclarations réglementaires, modèles de machine learning et communications clients se dégradent tous quand les données sous-jacentes sont fausses, obsolètes ou dupliquées. Le coût apparaît rarement sur une ligne budgétaire ; il se manifeste en retravail, mauvaises décisions, risque de conformité et perte de confiance dans la donnée.
Comment on l'utilise en pratique
Les entreprises opérationnalisent la data quality via :
- Le profiling : scanner les données pour repérer patterns, plages de valeurs et anomalies.
- Les règles et la validation : coder les attentes (par exemple, `age between 0 and 120`).
- Les scorecards et seuils : suivre les scores par dimension dans le temps et alerter en cas de baisse.
- La remédiation : corriger à la source, dédoublonner, enrichir à partir de référentiels de confiance.
- La responsabilité : désigner des data stewards redevables sur des domaines précis.
La qualité se mesure en continu, pas une fois pour toutes. Une pratique courante consiste à associer un data quality score (pourcentage d'enregistrements conformes aux règles) à chaque jeu de données critique.
Exemple chiffré
Une entreprise dispose de 100 000 enregistrements clients. Les contrôles révèlent :
- 4 000 doublons (échec sur l'unicité).
- 7 000 adresses email manquantes (échec sur la complétude).
- 2 000 codes postaux invalides (échec sur la validité).
Si une campagne marketing cible par email, environ 7 % des clients sont injoignables et les doublons gonflent le reach déclaré. Dédoublonner et valider d'abord améliore la précision de la campagne et réduit le budget gaspillé. Le même jeu de données nettoyé alimente ensuite les équipes finance et IA : une seule correction produit des effets cumulés sur plusieurs fonctions.

Questions fréquentes
Que signifie concrètement la qualité des données ?
La qualité des données mesure à quel point un jeu de données convient à l'usage qu'on en fait. C'est un jugement relatif à un usage précis, pas une norme absolue : un fichier client suffisant pour une segmentation marketing peut être inutilisable en reporting financier. On l'évalue généralement selon six dimensions : exactitude, complétude, cohérence, fraîcheur, validité et unicité.
Quelles sont les six dimensions de la qualité des données ?
L'exactitude (les valeurs décrivent la réalité), la complétude (les champs et enregistrements attendus sont présents), la cohérence (les valeurs concordent entre systèmes), la fraîcheur (les données sont assez récentes pour la décision), la validité (les valeurs respectent les règles et formats définis) et l'unicité (pas de doublons involontaires). Chaque dimension se dégrade différemment et demande ses propres contrôles : un doublon relève de l'unicité, un email vide de la complétude.
Qui, dans un comité de direction, est concerné par la qualité des données ?
Les directions marketing, finance, data et IA héritent toutes de la qualité des mêmes sources. Un CMO la constate en contacts injoignables et en reach surévalué, un CFO en reporting à refaire, un CDO en perte de confiance dans les dashboards, un responsable IA en modèles entraînés sur des valeurs fausses. C'est cette dépendance partagée qui fait qu'un seul chantier de nettoyage profite à plusieurs fonctions.
Comment mesure-t-on la qualité des données en pratique ?
En traduisant les attentes en règles (par exemple, âge entre 0 et 120), en les exécutant en continu et en suivant la part d'enregistrements conformes. L'usage courant consiste à attacher un data quality score, soit le pourcentage d'enregistrements qui passent les règles, à chaque jeu de données critique, avec des seuils d'alerte quand il baisse. Le profiling vient avant : il sert à repérer motifs, plages de valeurs et anomalies pour écrire les bonnes règles.
Que coûte une mauvaise qualité de données sur un fichier de 100 000 clients ?
Prenez un fichier comportant 4 000 doublons, 7 000 adresses email manquantes et 2 000 codes postaux invalides. Une campagne email n'atteint pas environ 7 % des clients, et les doublons gonflent le reach déclaré : le budget comme la lecture de performance sont faussés. Dédupliquer et valider avant l'envoi améliore le ciblage, et le fichier nettoyé sert ensuite aussi aux équipes finance et IA.