Accueil > Formations > Intelligence artificielle & Data Science > Data Science & Machine Learning > PySpark
PySpark
Maîtrisez PySpark pour traiter et analyser des volumes massifs de données !
Vue d'ensemble
Notions de base sur le langage Python ; notions sur les environnements data (modèle en étoile, Azure)
Objectifs pédagogiques
Programme détaillé
Environnement Python et prise en main
– Présentation du langage Python : positionnement, écosystème et cas d’usage en data engineering
– Installation de Python et des bibliothèques : mise en place de PySpark, pandas et des dépendances nécessaires
– Environnement virtuel : création et gestion d’un environnement isolé pour le projet
– Jupyter Notebooks : introduction à l’outil interactif pour l’exploration de données
– Bases de Python : rappel des fondamentaux du langage pour le traitement de données
Architecture et DataFrames PySpark
– DataFrames en Big Data : rôle central des DataFrames dans le traitement de données volumineuses
– Chargement des données : lecture de fichiers CSV, JSON et Parquet via PySpark
– Connexion aux systèmes de stockage : accès aux données depuis Azure Data Lake
– Filtrage, tri et agrégation : opérations de sélection et de regroupement sur les DataFrames
– Jointures entre DataFrames : croisement de plusieurs jeux de données
– Création de colonnes et transformations : enrichissement et restructuration des données
– Traitement des valeurs manquantes : détection et gestion des données incomplètes
Connexion à Azure Data Lake et SQL Server
– Architecture Azure Data Lake : présentation des couches de stockage et de leur organisation
– Lecture et écriture de fichiers : manipulation de données dans Azure Data Lake avec PySpark
– Authentification et clés d’accès : configuration sécurisée de la connexion aux ressources Azure
– Connexion SQL Server via JDBC : lecture et écriture de données dans une base relationnelle
– Exécution de requêtes SQL : sélection, transformation et extraction de données avec PySpark
– Sauvegarde des résultats : persistance des traitements dans les bases de données relationnelles
Pipeline de transformation de données
– Conception d’un pipeline complet : architecture du flux de données de bout en bout
– Chargement multi-sources : ingestion de données depuis Azure Data Lake et fichiers CSV
– Nettoyage des données : détection et correction des anomalies et incohérences
– Transformations avancées : jointures, agrégations et enrichissement des données
– Enregistrement en base de données : chargement des résultats transformés dans SQL Server
– Optimisations et bonnes pratiques : amélioration des performances et maintenabilité du pipeline
Prochaines sessions
Avis des participants
Financement
Cette formation est éligible aux financements OPCO et FNE-Formation. Nos équipes vous accompagnent dans le montage de votre dossier.
En savoir plus sur le financement
