ETL
Aussi : Extract Transform Load, Extract, Transform, Load, data pipeline
L'ETL (Extract, Transform, Load) est un processus d'intégration de données qui extrait les données de sources multiples, les remet en forme dans un format cohérent et les écrit dans un système cible.
Ce qu'est l'ETL
ETL signifie Extract, Transform, Load. C'est un pattern d'intégration de données utilisé pour déplacer des données d'un ou plusieurs systèmes sources vers un système cible, généralement un data warehouse, un data mart ou une base analytique. Les trois étapes s'enchaînent :
- Extract : lire les données brutes depuis des sources telles que bases de données, API, fichiers plats (CSV, JSON), applications SaaS ou flux d'événements.
- Transform : nettoyer, valider, dédupliquer, joindre, agréger et reformater les données pour qu'elles respectent le schéma cible et les règles métier.
- Load : écrire les données transformées dans la destination, soit en rafraîchissement complet, soit en mises à jour incrémentales.
Pourquoi c'est important
Les données brutes sont rarement exploitables en l'état. Elles arrivent dans des formats, des unités et des niveaux de qualité différents, souvent réparties sur de nombreux systèmes. L'ETL crée une version unique, fiable et cohérente des données pour que les équipes puissent produire des rapports et analyser en confiance.
- Qualité des données : les enregistrements erronés sont détectés et corrigés avant d'atteindre les dashboards.
- Cohérence : devises, dates et identifiants clients sont standardisés.
- Performance : les traitements lourds ont lieu une seule fois, en amont, au lieu d'être répétés à chaque requête.
- Gouvernance : un pipeline maîtrisé rend possibles le lineage et l'audit.
Comment on l'utilise en pratique
Les pipelines ETL sont généralement planifiés (par exemple la nuit) ou déclenchés par des événements. Les outils d'orchestration coordonnent les étapes, gèrent les reprises et alertent en cas d'échec. Une variante moderne courante est l'ELT, où les données brutes sont d'abord chargées puis transformées dans un warehouse cloud puissant. L'ETL est souvent préféré quand les transformations sont complexes ou quand des données sensibles doivent être nettoyées avant d'atterrir.
Exemple concret
Un distributeur veut un rapport de ventes quotidien combinant les données online et en magasin.
1. Extract : récupérer les commandes depuis une base PostgreSQL du magasin et une API Shopify.
2. Transform : convertir tous les prix en euros, standardiser les timestamps en UTC, dédupliquer les retours et mapper les deux systèmes sur un catalogue produits unique.
3. Load : insérer les enregistrements propres dans une table `fact_sales` du warehouse.
Les analystes interrogent ensuite une seule table propre au lieu de réconcilier à la main deux sources désordonnées, ce qui économise des heures et réduit les erreurs.
Voir aussi
Questions fréquentes
Que signifie ETL ?
ETL signifie Extract, Transform, Load. C'est un schéma d'intégration de données qui lit les données depuis des systèmes sources (bases, APIs, fichiers plats), les nettoie et les met en forme selon le schéma cible et les règles métier, puis les écrit dans une destination de type data warehouse ou base analytique.
Quelle différence entre ETL et ELT ?
L'ordre des deux dernières étapes change. En ETL, les données sont transformées avant d'être écrites dans la destination ; en ELT, les données brutes sont chargées d'abord puis transformées dans un cloud warehouse puissant. L'ETL reste préféré quand les transformations sont complexes ou quand des données sensibles doivent être nettoyées avant d'atterrir.
Pourquoi ne pas interroger directement les systèmes sources ?
Parce que les données brutes sont rarement exploitables telles quelles : formats, unités et niveaux de qualité diffèrent d'un système à l'autre. L'ETL produit une version unique et fiable, standardise devises, dates et identifiants clients, et déplace les traitements lourds en amont pour qu'ils s'exécutent une fois au lieu d'être répétés à chaque requête. Il rend aussi la traçabilité et l'audit possibles.
Que se passe-t-il concrètement pendant l'étape Transform ?
Les données sont nettoyées, validées, dédupliquées, jointes, agrégées et reformatées pour respecter le schéma cible et les règles métier. Concrètement : convertir tous les prix dans une seule devise, ramener les horodatages en UTC, supprimer les retours en doublon, faire correspondre plusieurs systèmes à un catalogue produit unique.
À quelle fréquence tourne un pipeline ETL, et qui le surveille ?
Les pipelines ETL sont généralement planifiés, souvent en exécution nocturne, ou déclenchés par des événements. Des outils d'orchestration enchaînent les étapes, gèrent les reprises et alertent en cas d'échec. Le chargement se fait soit en rafraîchissement complet, soit par mises à jour incrémentales, selon le volume et la fraîcheur attendue.