Big Data / Data Engineering
Une formation 100% pratique de 36 heures couvrant Python, l'écosystème Hadoop, Apache Spark et Airflow — construite autour d'un projet fil rouge de bout en bout, avec un voucher d'examen de certification Databricks inclus.
Des fondamentaux Python à un pipeline de données de type production
12 séances sur 6 semaines. Voici la répartition des modules, avec le volume horaire de chacun.
Python (6h)
Syntaxe, exemples et exercices : variables, fonctions, exceptions, la librairie requests et plus encore.
Introduction au Big Data (3h)
Comment et pourquoi : les 3V, cluster, scalabilité et théorème CAP, ainsi qu'un aperçu des bases de données SQL / NoSQL.
Hadoop (6h)
Composants principaux (HDFS/YARN) avec exercices pratiques sur la CLI HDFS et l'UI YARN, exemples de MapReduce, et l'écosystème Hadoop (Pig/Hive) avec exercices Hive.
Apache Spark (9h)
Composants principaux (Spark SQL, ML, Streaming, GraphX, RDD/DataFrame) abordés en théorie, puis mis en pratique via des exemples et exercices de traitement batch.
Airflow (3h)
Installation et configuration d'Airflow pour orchestrer des pipelines de données.
Projet fil rouge (6h)
Collecter, stocker et analyser des données de compagnies aériennes de bout en bout avec Hadoop, Hive, Spark et Airflow.
Examen blanc (3h)
Un examen blanc complet pour la certification Databricks Certified Associate Developer for Apache Spark 3.0 - Python.
Pour qui est cette formation ?
Cette formation s'adresse aux professionnels et étudiants souhaitant se spécialiser en ingénierie de la donnée. Des bases techniques sont recommandées :
- ✓ Notions d'algorithmique
- ✓ Bases en SQL
- ✓ Notions de Linux (ligne de commande)
Modalités d'inscription
L'inscription est confirmée après réception d'un acompte de 10% du montant de la formation. Le solde est réglé selon les modalités communiquées à l'inscription.
Avis de nos anciens stagiaires
"Formation de qualité qui présente les dernières technologies du monde du Big Data, en combinant théorie et surtout pratique. Elle est animée par un formateur pédagogue et patient, qui maîtrise parfaitement son sujet et parvient à transmettre les informations avec aisance. Je recommande fortement cette formation."
"Je recommande vivement cette formation et je remercie le formateur pour son professionnalisme et la qualité du contenu. Ce que j'ai le plus apprécié, c'est d'avoir pu faire des exercices pratiques et un projet final sur un environnement Big Data distribué — un avantage qu'on ne trouve pas dans les cours en ligne. J'ai aussi bien compris l'écosystème Hadoop, ainsi que les différences et similarités entre les différentes technologies du Big Data, leurs avantages, leurs inconvénients et leurs cas d'usage, ce qui m'a permis de comprendre l'architecture globale."
"Une très bonne formation, très riche, j'ai beaucoup appris. Merci au formateur pour sa pédagogie et sa patience. Je recommande vivement cette formation."
Réservez votre place dès maintenant
Places limitées à 10 participants. Laissez-nous vos coordonnées pour être recontacté rapidement.