+50 XP

Les data catalogs en pratique : Alation, Collibra et DataHub comparés

Toute organisation a besoin d'un data catalog. La plupart en achètent un et le regardent prendre la poussière.

Le scénario d'échec d'un data catalog est prévisible : la direction s'enthousiasme pour la promesse d'« un seul endroit pour trouver toutes vos données ». Un outil est choisi (Collibra, Alation, DataHub). L'implémentation démarre. Les équipes engineering documentent automatiquement les métadonnées techniques. Les utilisateurs métier sont invités à rédiger les définitions. Six mois plus tard : les métadonnées techniques sont là, l'essentiel des métadonnées métier manque, et l'adoption plafonne à 12 %.

L'outil n'est pas le problème. La stratégie d'adoption est le problème.

Ce que fait réellement un data catalog

Un data catalog remplit quatre fonctions :

1. Discovery : les utilisateurs métier et les analystes peuvent rechercher des actifs de données (tables, dashboards, modèles ML, API) avec des termes métier plutôt que des noms techniques. « Montre-moi tout ce qui concerne le churn client » : le catalog fait remonter les tables, dashboards et documentations pertinents.

2. Contexte : pour chaque actif, le catalog indique qui en est propriétaire, sa fraîcheur, le nombre d'utilisateurs, ses liens avec d'autres actifs (data lineage), les problèmes de qualité connus et les définitions métier des champs clés.

3. Gouvernance : le catalog héberge les classifications de données (PII, confidentiel, public), les politiques d'accès qui y sont rattachées, et la certification des données (ce jeu de données a été revu et est fiable).

4. Collaboration : les data stewards documentent les définitions. Les analystes laissent des commentaires et des questions. Les data owners approuvent ou rejettent les définitions proposées. Le catalog devient un document vivant, pas un registre statique.

Comparaison des outils : choisir son catalog

Collibra : de niveau entreprise, workflows de gouvernance solides, gestion intégrée des politiques de données, fonctionnalités de conformité. Idéal pour les grandes organisations en secteurs régulés (banque, assurance, santé). Complexité d'implémentation élevée ; nécessite généralement un partenaire d'implémentation dédié. Coût : plusieurs centaines de milliers par an.

Alation : fort sur l'active metadata : il suit la façon dont les données sont réellement utilisées, fait remonter les requêtes populaires, identifie les experts métier par les schémas d'usage. Populaire dans les entreprises mid-market et les organisations tech matures sur la data. Excellent support de l'analytics en self-service.

DataHub (LinkedIn, open-source) : gratuit, très personnalisable, bonne intégration avec les modern data stacks (dbt, Airflow, Spark). Demande un investissement engineering pour le déployer et le maintenir. En croissance rapide dans les organisations disposant d'une forte capacité de data engineering. Coût : du temps d'engineering plutôt que des licences.

Atlan : conçu pour le modern data stack. Intégrations solides avec dbt, Looker, Snowflake. Fonctionnalités collaboratives (discussions à la Slack sur les actifs de données). La croissance la plus rapide du segment. Adapté aux organisations qui utilisent un outillage moderne, cloud-native.

Collibra Vs. Monte Carlo Vs. Atlan: Data Lineage/Catalog Tools Compared

Watch on YouTube

Vérification des acquis

1. D'après la leçon, quelle est la principale raison pour laquelle les implémentations de data catalog échouent généralement à être adoptées ?

2. Un analyste recherche « tout ce qui concerne le churn client » et le catalog renvoie les tables, dashboards et documentations pertinents. Quelle fonction centrale du catalog cela illustre-t-il ?

3. Une grande banque, dans un secteur fortement régulé, a besoin de workflows de gouvernance solides et de fonctionnalités de conformité intégrées, et peut se payer un partenaire d'implémentation dédié. Quel catalog est le plus adapté ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les affirmations qui décrivent correctement la fonction « Contexte » d'un data catalog.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les affirmations qui distinguent correctement Alation et DataHub tels que décrits dans la leçon.

Sélectionnez toutes les réponses correctes.

Le problème d'adoption (et comment le résoudre)

Un data catalog peu adopté est pire que pas de data catalog : il crée la fausse confiance qu'une gouvernance existe alors que le paysage de données reste non documenté.

Les cinq modes d'échec de l'adoption :

  1. La charge documentaire repose sur les ingénieurs : les ingénieurs documenteront les métadonnées techniques parce que les outils l'automatisent. Ils ne passeront pas des heures à rédiger des définitions métier. Ne le leur demandez pas.
  1. Aucune intégration dans les workflows existants : si les analystes doivent ouvrir un outil séparé pour consulter les définitions de données, ils ne le feront pas. Le catalog doit apparaître là où les gens travaillent déjà : dans Slack (bot de recherche dans le catalog), dans leur outil BI (intégration Looker ou Tableau), dans l'interface du data warehouse.
  1. Vouloir tout couvrir d'emblée : chercher à documenter chaque jeu de données avant le lancement, c'est lancer avec une documentation médiocre de milliers d'actifs au lieu d'une documentation excellente de quelques centaines. Commencez par vos 20 jeux de données les plus utilisés et rendez-les parfaits.
  1. Aucune incitation à la curation : pourquoi un data steward passerait-il du temps à rédiger des définitions dans le catalog ? Créez de la reconnaissance : un prix du « contributeur du mois », une intégration dans les évaluations de performance des rôles data, un score de qualité public par domaine.
  1. Mauvais indicateur de succès : le « nombre d'actifs documentés » est une vanity metric. Suivez le « pourcentage de consommateurs de données qui ont trouvé ce qu'ils cherchaient dans le catalog », un indicateur issu d'enquêtes qui mesure réellement si le catalog fonctionne.

L'implémentation de Collibra chez ING

ING Bank a déployé Collibra comme data catalog d'entreprise dans plus de 40 pays. Leur facteur de réussite : ils n'ont pas implémenté un catalog, ils ont implémenté un modèle opérationnel de gouvernance des données qui utilisait Collibra comme outil.

Ils ont d'abord défini la propriété des données. Ils ont ensuite formé les data stewards. Ils ont construit les workflows de gouvernance en troisième. L'outil en dernier. Cette séquence, les personnes et les processus avant la technologie, est systématiquement ce qui différencie les implémentations de catalog qui fonctionnent de celles qui échouent.

À faire, tiré de cette leçon

Ces actions sont compilées dans le plan d'action du rôle.

  • Constituez et récompensez un réseau nommé de Data Stewards avant d'acheter la technologie
  • Déployer un data catalog intégré aux workflows existants, en documentant d'abord les assets les plus utilisés
Voir le plan d'action complet →

Articles liés

Les articles récents du blog qui s'appuient sur cette leçon.