+65 XP

Self-serve analytics : architecture, data catalog et data literacy

Le self-serve analytics, c'est la promesse que les utilisateurs métier, et pas seulement les analystes, puissent répondre eux-mêmes à leurs questions data. Bien fait, cela élargit l'accès aux données sans faire grossir l'équipe data. Mal fait, cela crée un cauchemar de gouvernance et un océan de métriques incohérentes.

La plupart des organisations ont tenté le self-serve analytics et échoué au moins une fois. Le mode d'échec est prévisible : déployer un outil BI, l'appeler « self-serve », et regarder les utilisateurs créer des centaines de versions légèrement différentes du même dashboard, chacune avec une définition légèrement différente du revenu.

Réussir le self-serve demande plus qu'un outil. Cela demande une architecture.

La pyramide du self-serve

Le self-serve analytics fonctionne à différents niveaux de sophistication :

Niveau 1, consommateurs de reporting : consultent des dashboards préconstruits. Filtrent, font du drill-down. Aucune création. La majorité des utilisateurs métier se situe ici.

Niveau 2, constructeurs de reporting : créent leurs propres dashboards à partir de datasets approuvés. Pas de modélisation de données. Les outils BI comme Tableau et Power BI le permettent.

Niveau 3, constructeurs de datasets : créent de nouveaux datasets en joignant des tables approuvées. Nécessite du SQL ou des capacités BI avancées. Les power users et les business analysts se situent ici.

Niveau 4, modélisateurs de données : définissent de nouvelles métriques, créent de nouveaux modèles de données. Nécessite la supervision de l'équipe data. Réservé aux analystes embedded ou aux power users certifiés.

Une architecture self-serve sert les quatre niveaux, elle ne cherche pas à faire de chacun un utilisateur de niveau 4.

How to Build a Self-Serve Analytics Culture

Watch on YouTube

Vérification des acquis

1. Quel est le mode d'échec le plus fréquent lorsque les organisations se lancent dans le self-serve analytics ?

2. Selon la pyramide du self-serve, qu'est-ce qui distingue un « constructeur de datasets » de niveau 3 d'un « constructeur de reporting » de niveau 2 ?

3. Pourquoi un data catalog est-il essentiel à mesure que les actifs de données se multiplient dans une organisation ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les affirmations qui décrivent correctement les principes d'une architecture self-serve bien conçue.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUS les éléments de métadonnées que la leçon indique pour chaque actif d'un data catalog.

Sélectionnez toutes les réponses correctes.

Le data catalog : la découvrabilité à l'échelle

À mesure que les actifs de données se multiplient, la découvrabilité devient critique. Les utilisateurs ne peuvent pas utiliser des données qu'ils ne trouvent pas. Le data catalog résout ce problème.

Un data catalog est un inventaire consultable de tous les actifs de données : tables, dashboards, métriques, data products. Chaque actif comporte : une description, un owner, sa fraîcheur, un score de qualité, une politique d'accès et un échantillon.

Sans catalog, les utilisateurs demandent à l'équipe data « quelles données avons-nous sur X ? », un goulot d'étranglement. Avec un catalog, ils cherchent et trouvent eux-mêmes.

Outils : Collibra (enterprise, complet, cher), Alation (forte data intelligence et recherche), DataHub (open-source, construit par LinkedIn), Amundsen (open-source, construit par Lyft).

Le catalog « Dataportal » d'Airbnb a réduit de 40 % les demandes entrantes vers l'équipe data en permettant la découverte en self-service. Le catalog n'est pas un nice-to-have pour une grande plateforme data, c'est de l'infrastructure.

Le self-serve gouverné : l'équilibre

Le self-serve pur sans gouvernance crée le chaos. Une gouvernance totale sans self-serve crée des goulots d'étranglement. L'équilibre :

Certifier les datasets : marquer les datasets comme « certifiés », testés en qualité, documentés et fiables. Les utilisateurs savent qu'ils peuvent s'appuyer sur les datasets certifiés. Tout le reste est expérimental.

Définir les Golden Metrics : 20 à 30 métriques business centrales définies de façon faisant autorité. Revenu, DAU, taux de conversion, churn, chacune a une seule définition, maintenue par l'équipe data. Les utilisateurs peuvent construire leurs propres analyses mais les Golden Metrics sont la source de vérité.

Usage analytics de la plateforme data : suivre quels datasets sont utilisés, par qui et comment. Les datasets non utilisés sont candidats à la dépréciation. Les datasets très utilisés sont candidats à l'optimisation.

Data literacy : la couche humaine

La technologie est la partie la plus facile. La plus difficile, c'est la data literacy, la capacité organisationnelle à interpréter les données et à agir dessus.

Une organisation data-literate comprend : ce que signifie la significativité statistique, pourquoi corrélation n'est pas causalité, comment lire un intervalle de confiance, quand une tendance est réelle ou du bruit.

Développer la data literacy exige : des programmes de formation formels, un support d'analystes embedded pour les équipes métier, une documentation accessible et l'exemplarité des dirigeants (les leaders qui utilisent visiblement la donnée installent la norme).

Le programme de data literacy de Broadridge Financial a formé plus de 10 000 collaborateurs aux fondamentaux de la donnée en deux ans. Résultats mesurables : une adoption plus forte des dashboards, des cycles de décision plus rapides et une baisse des demandes adressées à l'équipe data centrale par des utilisateurs en quête d'aide à l'interprétation.

Quiz Questions

  1. Quel est le principal problème qui survient quand on déploie un outil BI sans architecture de self-serve ?

A) L'outil est trop lent

B) Les utilisateurs créent des centaines de versions légèrement différentes des mêmes métriques, avec des définitions incohérentes

C) Les données ne sont pas accessibles

D) Le coût de la licence est trop élevé

Réponse: B

  1. À quel niveau de la "pyramide du self-serve" se situe un utilisateur qui peut créer ses propres dashboards depuis des datasets approuvés sans modélisation de données ?

A) Niveau 1

B) Niveau 2

C) Niveau 3

D) Niveau 4

Réponse: B

  1. Qu'est-ce qu'un data catalog permet principalement ?

A) Accélérer les requêtes SQL

B) Sécuriser l'accès aux données

C) Rendre les actifs de données découvrables et documentés, permettant aux utilisateurs de trouver eux-mêmes les données sans solliciter l'équipe data

D) Automatiser la création de dashboards

Réponse: C

À faire, tiré de cette leçon

Ces actions sont compilées dans le plan d'action du rôle.

  • Construire un programme de data literacy avec formation, analysts intégrés et exemplarité du comité de direction
Voir le plan d'action complet →

Articles liés

Les articles récents du blog qui s'appuient sur cette leçon.