Accueil > Formations > Cloud Computing > Amazon Web Services (AWS) > Building Batch Data Analytics Solutions on AWS (BBDAS)
Building Batch Data Analytics Solutions on AWS (BBDAS)
Construisez des pipelines d’analytique batch performants sur AWS avec Amazon EMR, Spark et Hadoop !
Vue d'ensemble
Le cours aborde l’ensemble de la chaîne data — collecte, ingestion, catalogage, stockage et traitement — dans un contexte Spark/Hadoop. Vous apprendrez également à exploiter EMR Notebooks pour des cas d’usage d’analytique et de machine learning, tout en appliquant les bonnes pratiques de sécurité, de performance et de maîtrise des coûts dans l’exploitation d’Amazon EMR.
Cette formation s’inscrit dans le parcours de préparation à la certification AWS Certified Data Engineer – Associate.
Disposer idéalement d’au moins 1 an d’expérience sur des frameworks data open source (ex.
Apache Spark ou Apache Hadoop).
Recommandé : avoir suivi Architecting on AWS (AWSA) ou AWS Technical Essentials (AWSE).
Recommandé : avoir suivi Building Data Lakes on AWS (BDLA) ou Getting Started with AWS Glue.
Objectifs pédagogiques
Programme détaillé
Module A : Panorama de l’analytique et du pipeline de données
Cas d’usage de l’analytique de données
Exploiter un pipeline data pour l’analyse
Module 1 : Prise en main d’Amazon EMR
Positionnement d’Amazon EMR dans des solutions analytiques
Architecture d’un cluster Amazon EMR
Démo : démarrer un cluster Amazon EMR
Stratégies de gestion et d’optimisation des coûts
Module 2 : Pipeline analytique avec Amazon EMR – Ingestion et stockage
Optimiser le stockage avec Amazon EMR
Techniques d’ingestion de données
Module 3 : Analytique batch haute performance avec Apache Spark sur Amazon EMR
Cas d’usage de Spark sur Amazon EMR
Pourquoi utiliser Spark sur Amazon EMR
Concepts clés de Spark
Démo : connexion à un cluster EMR et exécution de commandes Scala via le Spark shell
Transformation, traitement et analyse
Utilisation des notebooks avec Amazon EMR
TP : analytique à faible latence avec Apache Spark sur Amazon EMR
Module 4 : Traitement et analyse batch avec Amazon EMR et Apache Hive
Traiter des données batch avec Hive sur Amazon EMR
Transformation, traitement et analyse
TP : traitement batch avec Amazon EMR et Hive
Introduction à Apache HBase sur Amazon EMR
Module 5 : Traitement serverless des données
Traitement, transformation et analyse en mode serverless
Exploiter AWS Glue avec des workloads Amazon EMR
TP : orchestrer un traitement Spark avec AWS Step Functions
Module 6 : Sécurité et supervision des clusters Amazon EMR
Sécurisation des clusters EMR
Démo : chiffrement côté client avec EMRFS
Supervision et dépannage des clusters Amazon EMR
Démo : analyse de l’historique d’un cluster Apache Spark
Module 7 : Concevoir des solutions d’analytique batch
Cas d’usage d’analytique batch
Atelier : concevoir un workflow d’analytique batch
Module B : Développer des architectures data modernes sur AWS
Architectures data modernes sur AWS
Prochaines sessions
Avis des participants
Financement
Cette formation est éligible aux financements OPCO et FNE-Formation. Nos équipes vous accompagnent dans le montage de votre dossier.
En savoir plus sur le financement
