Glossaire
Data

Data Catalog

Aussi : Metadata Catalog, Data Asset Catalog, Enterprise Data Catalog

Un inventaire centralisé des actifs de données d'une organisation, enrichi de métadonnées, qui aide chacun à trouver, comprendre et faire confiance aux données dont il a besoin.

De quoi il s'agit

Un data catalog est un système centralisé qui inventorie les actifs de données d'une organisation et les décrit à l'aide de métadonnées. Voyez-le comme un annuaire de données interrogeable : tables, fichiers, dashboards, features de machine learning et les relations entre eux. Plutôt que de demander à des collègues où se trouve un dataset ou ce que signifie une colonne, les utilisateurs cherchent dans le catalog et obtiennent des réponses appuyées par un contexte documenté.

Un catalog capture généralement :

  • Métadonnées techniques : schémas, noms de colonnes, types de données, formats de fichiers, emplacements.
  • Métadonnées métier : descriptions en langage clair, termes métier, ownership, classifications.
  • Métadonnées opérationnelles : fraîcheur, fréquence de mise à jour, nombre de lignes, usage en requêtes.
  • Lineage : comment les données circulent des systèmes sources jusqu'aux rapports en passant par les transformations.

Pourquoi c'est important

À mesure que le volume de données et le nombre d'outils augmentent, les équipes perdent du temps à chercher le bon dataset ou en utilisent un mauvais sans le savoir. Un data catalog réduit cette friction et sert plusieurs objectifs :

  • Discovery : chacun trouve rapidement des données pertinentes et fiables.
  • Confiance : ownership documenté, indicateurs de qualité et lineage rendent les données crédibles.
  • Gouvernance : les données sensibles peuvent être taguées, classifiées et leurs accès contrôlés.
  • Collaboration : des définitions partagées réduisent les métriques contradictoires entre équipes.
  • Efficacité : moins de travail dupliqué et moins de datasets redondants.

Pour un Chief Data Officer, le catalog est une infrastructure fondatrice pour la gouvernance des données, la conformité (par exemple le RGPD) et une culture data driven.

Comment on l'utilise en pratique

Beaucoup de catalogs scannent automatiquement les systèmes connectés (warehouses, lakes, outils BI) pour collecter les métadonnées. Les stewards enrichissent ensuite les entrées avec des descriptions, des termes de glossaire et des tags. Les catalogs modernes ajoutent le lineage automatisé, des scores de qualité de données et des demandes d'accès.

Exemple concret

Une analyste marketing a besoin d'une mesure fiable du churn client. Elle cherche churn dans le catalog, trouve une table certifiée nommée `customer_churn_monthly`, lit sa définition, voit qu'elle appartient à l'équipe analytics, qu'elle est mise à jour quotidiennement et notée de haute qualité. Le lineage montre qu'elle dérive des sources CRM et facturation. Elle demande l'accès, l'obtient, et construit son rapport en quelques minutes au lieu de plusieurs jours, avec la certitude d'utiliser la définition validée plutôt qu'une copie obsolète.

How a Data Catalog WorksWarehouseData LakeBI ToolsSourcesData Catalogmetadatalineage, tagsscanSearchUnderstandGovernUsers
A catalog scans sources for metadata, then powers discovery, understanding, and governance for users.

Questions fréquentes

Qu'est-ce qu'un data catalog ?

Un data catalog est un système centralisé qui recense les actifs de données d'une organisation et les décrit avec des métadonnées. Il fonctionne comme un annuaire interrogeable de tables, fichiers, dashboards, features de machine learning et des liens entre eux. Plutôt que de demander à un collègue où se trouve un jeu de données ou ce que signifie une colonne, l'utilisateur cherche dans le catalogue et obtient une réponse documentée.

Quelles métadonnées un data catalog contient-il concrètement ?

Quatre familles. Les métadonnées techniques (schémas, noms de colonnes, types, formats, emplacements), les métadonnées métier (descriptions en langage clair, termes du glossaire, propriétaire, classifications), les métadonnées opérationnelles (fraîcheur, fréquence de mise à jour, nombre de lignes, usage en requêtes) et le lineage, qui retrace le parcours de la donnée des systèmes sources jusqu'aux rapports.

Quelle différence entre un data catalog et un data warehouse ?

Un data warehouse stocke les données ; un data catalog stocke l'information sur les données. Le catalogue indique où se trouvent les jeux de données à travers warehouses, lakes et outils de BI, et explique ce qu'ils signifient, qui en est propriétaire et à quel point ils sont à jour. Les deux sont complémentaires : les catalogues scannent généralement les warehouses pour en récolter les métadonnées.

Pourquoi un Chief Data Officer s'intéresse-t-il à un data catalog ?

Parce qu'il constitue l'infrastructure de base de la gouvernance, de la conformité et d'une culture data. Les données sensibles peuvent y être taguées, classifiées et soumises à un contrôle d'accès, ce qui sert des obligations comme le RGPD. Les définitions partagées réduisent aussi les métriques contradictoires entre équipes et les jeux de données créés en doublon.

Comment utilise-t-on un data catalog au quotidien ?

Prenez une analyste qui cherche une mesure fiable du churn : elle interroge le catalogue sur « churn », trouve une table certifiée comme customer_churn_monthly, lit sa définition, voit qu'elle appartient à l'équipe analytics, qu'elle est mise à jour quotidiennement et notée de bonne qualité. Le lineage montre qu'elle dérive du CRM et de la facturation. Elle demande l'accès, l'obtient et construit son rapport en quelques minutes plutôt qu'en plusieurs jours, sur la définition validée et non sur une copie périmée.