Glossaire
Data

Data Warehouse

Aussi : DWH, Enterprise Data Warehouse, EDW

Un référentiel central qui consolide les données de nombreux systèmes sources dans un stockage structuré et optimisé pour les requêtes, conçu pour l'analytique, le reporting et la business intelligence.

De quoi il s'agit

Un data warehouse est un référentiel central et intégré conçu pour stocker de grands volumes de données historiques et actuelles provenant de plusieurs systèmes sources, à des fins d'analyse et de reporting. Contrairement à une base de données opérationnelle (OLTP) réglée pour des insertions et des mises à jour rapides, un data warehouse est optimisé pour les requêtes analytiques (OLAP) : parcourir, agréger et joindre de grands jeux de données pour répondre à des questions business.

Les données sont chargées via des pipelines ETL (Extract, Transform, Load) ou ELT qui nettoient, standardisent et remodèlent les entrées brutes en tables cohérentes, prêtes à être requêtées. Le résultat : une source de vérité unique et fiable pour toute l'organisation.

Pourquoi c'est important

  • Source de vérité unique : marketing, finance et opérations reportent à partir des mêmes chiffres.
  • Performance : le stockage colonnaire et les modèles structurés rendent rapides les agrégations sur des millions de lignes.
  • Analyse historique : il conserve des snapshots horodatés, ce qui permet l'analyse de tendance et les comparaisons d'une année sur l'autre.
  • Gouvernance : contrôle d'accès centralisé, règles de qualité des données et lineage soutiennent la conformité.

Comment on l'utilise en pratique

La plupart des warehouses organisent les données avec une modélisation dimensionnelle (schémas en étoile ou en flocon) :

  • Les tables de faits contiennent les événements mesurables (ventes, clics, transactions).
  • Les tables de dimensions contiennent le contexte descriptif (client, produit, date, région).

Les analystes interrogent le warehouse en SQL, et les outils de BI (dashboards) se branchent par-dessus. Les data engineers gèrent les pipelines, l'ordonnancement et les couches de modélisation. Les warehouses cloud modernes séparent le stockage du compute, ce qui permet aux équipes de faire évoluer la puissance de calcul indépendamment et de payer à l'usage.

Exemple concret

Un distributeur collecte des commandes depuis une plateforme e-commerce, des systèmes d'encaissement en magasin et un CRM. Chaque nuit, un pipeline ELT charge ces sources dans le warehouse. Une table `fact_sales` enregistre chaque ligne de commande, reliée à `dim_customer`, `dim_product`, `dim_store` et `dim_date`.

Un analyste finance lance ensuite une seule requête pour calculer le chiffre d'affaires mensuel par région, pendant qu'un analyste marketing mesure les ventes générées par les campagnes, tous deux à partir des mêmes données gouvernées. Sans le warehouse, chaque équipe sortirait des chiffres contradictoires de systèmes isolés.

Concepts liés

Un data warehouse se distingue d'un data lake (stockage brut, schema-on-read) et d'un data mart (un sous-ensemble plus réduit, orienté département). Beaucoup d'organisations combinent ces éléments dans une architecture lakehouse.

Data Warehouse: from sources to insightCRME-commercePOS / ERPSourcesETL / ELTclean + modelDataWarehousefacts + dimsBI / ReportsAnalytics
Source systems feed an ETL/ELT pipeline that loads a modeled warehouse serving BI and analytics.

Voir aussi

Questions fréquentes

Qu'est-ce qu'un data warehouse, en termes simples ?

Un data warehouse est un référentiel central qui regroupe les données de plusieurs systèmes sources dans un entrepôt structuré, optimisé pour l'analyse et le reporting. Il conserve l'historique autant que les données récentes et il est taillé pour les requêtes analytiques (OLAP) : parcours, agrégations et jointures sur de gros volumes, là où une base opérationnelle (OLTP) est réglée pour des écritures rapides.

Quelle différence entre data warehouse, data lake et data mart ?

Le data warehouse stocke des données nettoyées et modélisées, prêtes à être requêtées ; le data lake conserve les données brutes en schema-on-read, la structure étant appliquée au moment de la requête ; le data mart est un sous-ensemble plus réduit, dédié à un département. Beaucoup d'organisations réunissent les deux premiers dans une architecture lakehouse.

Pourquoi un data warehouse si chaque outil produit déjà ses rapports ?

Parce que des systèmes isolés livrent des chiffres contradictoires. Le warehouse donne au marketing, à la finance et aux opérations les mêmes données gouvernées, conserve un historique horodaté pour les analyses de tendance et les comparaisons annuelles, et centralise droits d'accès, règles de qualité et lineage. C'est cette combinaison qui en fait une source unique de vérité.

Quelle différence entre ETL et ELT pour alimenter un data warehouse ?

L'ETL transforme les données avant de les charger dans le warehouse ; l'ELT charge d'abord les données brutes puis les transforme dans le warehouse, avec sa propre puissance de calcul. Les deux font le même travail (nettoyer, standardiser, remodeler en tables requêtables), mais l'ELT domine sur les warehouses cloud modernes, où stockage et compute se dimensionnent séparément et se paient à l'usage.

Comment s'organisent les tables de faits et de dimensions dans un schéma en étoile ?

En modélisation dimensionnelle, les tables de faits contiennent les événements mesurables (ventes, clics, transactions) et les tables de dimensions le contexte descriptif (client, produit, magasin, date). Un distributeur aura par exemple une table fact_sales enregistrant chaque ligne de commande, reliée à dim_customer, dim_product, dim_store et dim_date : la finance y calcule le chiffre d'affaires mensuel par région et le marketing y mesure les ventes générées par les campagnes, sur les mêmes tables.