Accueil > Formations > Intelligence artificielle & Data Science > Data Engineering & Big Data > Apache Hop : orchestrer et automatiser vos flux de données ETL
Apache Hop : orchestrer et automatiser vos flux de données ETL
Maîtrisez Apache Hop pour extraire, transformer et charger vos données depuis des sources hétérogènes grâce à des pipelines visuels et des workflows automatisés.
Vue d'ensemble
- Maîtrise du langage SQL (requêtes, jointures, types de données)
- Connaissance des concepts de bases de données relationnelles
Objectifs pédagogiques
Programme détaillé
Découverte d'Apache Hop et mise en place de l'environnement
– Positionnement d’Apache Hop : outil ETL open source et son rôle dans l’écosystème d’intégration de données
– Architecture de la plateforme : distinction entre pipelines (transformation) et workflows (orchestration)
– Historique et communauté : origines du projet, évolution depuis Kettle/Pentaho et gouvernance Apache
– Installation et configuration : mise en place de l’environnement de développement et premiers repères dans l’interface
– Installation d’Apache Hop et configuration d’un premier projet
– Navigation dans l’interface graphique et exploration des composants disponibles
Conception de pipelines et workflows
– Pipelines de transformation : création d’un flux de données de bout en bout, de la source à la cible
– Workflows d’orchestration : enchaînement et ordonnancement des pipelines pour automatiser un processus complet
– Exécution et supervision : lancement d’un pipeline et d’un workflow, lecture des résultats d’exécution
– Gestion des flux de données : appréhender le parcours des données à travers les étapes de transformation
– Conception d’un pipeline simple d’extraction et de chargement de données
– Élaboration d’un workflow orchestrant plusieurs pipelines séquentiels
Connexion aux sources et cibles de données
– Métadonnées de connexion : configuration et gestion centralisée des accès aux bases de données
– Connecteurs source et cible : panorama des systèmes supportés (bases relationnelles, fichiers, APIs)
– Jointures entre sources : liens et associations entre données issues de systèmes différents
– Alimentation en Insert/Update : stratégies d’insertion et de mise à jour des données cibles
– Configuration de connexions vers plusieurs bases de données
– Mise en place d’un flux d’alimentation avec gestion Insert/Update
Manipulation et transformation des flux de données
– Tri et ordonnancement : classement ascendant ou descendant des enregistrements d’un flux
– Dédoublement et filtrage : séparation d’un flux en sous-ensembles selon des critères métier
– Extraction de champs : récupération d’informations à partir de chaînes de caractères
– Remplacement et calculs : substitution de valeurs et opérations arithmétiques sur les données du flux
– Produit cartésien et jointures hétérogènes : croisement de données issues de sources différentes
– Comparaison de flux : détection de différences entre deux jeux de données
– Transformation d’un flux brut : tri, dédoublement et filtrage selon des règles métier
– Jointure de données issues de deux sources hétérogènes avec comparaison des résultats
Enrichissement des flux et gestion des variables
– Génération de logs : traçabilité des opérations et suivi de l’exécution des flux
– Variables et paramètres : création et récupération de variables (dates, numériques, alphanumériques) pour dynamiser les traitements
– Résultat de flux : exploitation de la sortie d’un pipeline dans un workflow ou un autre pipeline
– Propriétés d’ordonnancement : configuration des propriétés d’un flux et de son orchestrateur
– Paramétrage dynamique d’un pipeline à l’aide de variables de dates et de chemins
– Chaînage de deux pipelines en exploitant le résultat du premier comme entrée du second
Itérations et boucles
– Problématiques d’itération : cas d’usage nécessitant un traitement répétitif sur des jeux de données
– Boucles paramétrées : utilisation du composant « Copie lignes vers résultat » pour transmettre des données entre itérations
– Boucles avec récupération : combinaison des composants « Copie lignes vers résultat » et « Récupération lignes depuis le résultat » pour des traitements par lots
– Mise en place d’une boucle traitant un ensemble de fichiers de manière itérative
– Construction d’un workflow itératif avec passage de paramètres entre chaque tour de boucle
Exploitation, automatisation et mise en production
– Gestion des erreurs : détection, capture et traitement des erreurs dans les pipelines et workflows
– Débogage et alertes : analyse des traces d’exécution et mise en place de notifications en cas d’anomalie
– Parallélisation : exécution simultanée de plusieurs flux pour optimiser les temps de traitement
– Import/export des développements : portabilité des pipelines et workflows entre environnements
– Automatisation des tâches : planification et déclenchement automatique des traitements
– Documentation et normes : bonnes pratiques de nommage, commentaires et gestion des reprises sur erreur
– Exécution parallèle de plusieurs flux de données avec gestion des erreurs
– Automatisation d’un workflow complet avec planification et alertes en cas d’échec
Prochaines sessions
Avis des participants
Financement
Cette formation est éligible aux financements OPCO et FNE-Formation. Nos équipes vous accompagnent dans le montage de votre dossier.
En savoir plus sur le financement
