Durée36 heures — 12 séances sur 6 semaines
FormatÀ distance
Taille du groupe10 personnes maximum
TarifSur devis — acompte de 10% à l'inscription
Bonus — inclus Examen blanc + voucher de certification Databricks Certified Associate Developer for Apache Spark 3.0 - Python
Programme — 36 heures

Des fondamentaux Python à un pipeline de données de type production

12 séances sur 6 semaines. Voici la répartition des modules, avec le volume horaire de chacun.

1

Python (6h)

Syntaxe, exemples et exercices : variables, fonctions, exceptions, la librairie requests et plus encore.

2

Introduction au Big Data (3h)

Comment et pourquoi : les 3V, cluster, scalabilité et théorème CAP, ainsi qu'un aperçu des bases de données SQL / NoSQL.

3

Hadoop (6h)

Composants principaux (HDFS/YARN) avec exercices pratiques sur la CLI HDFS et l'UI YARN, exemples de MapReduce, et l'écosystème Hadoop (Pig/Hive) avec exercices Hive.

4

Apache Spark (9h)

Composants principaux (Spark SQL, ML, Streaming, GraphX, RDD/DataFrame) abordés en théorie, puis mis en pratique via des exemples et exercices de traitement batch.

5

Airflow (3h)

Installation et configuration d'Airflow pour orchestrer des pipelines de données.

6

Projet fil rouge (6h)

Collecter, stocker et analyser des données de compagnies aériennes de bout en bout avec Hadoop, Hive, Spark et Airflow.

7

Examen blanc (3h)

Un examen blanc complet pour la certification Databricks Certified Associate Developer for Apache Spark 3.0 - Python.

Prérequis

Pour qui est cette formation ?

Cette formation s'adresse aux professionnels et étudiants souhaitant se spécialiser en ingénierie de la donnée. Des bases techniques sont recommandées :

  • ✓ Notions d'algorithmique
  • ✓ Bases en SQL
  • ✓ Notions de Linux (ligne de commande)

Modalités d'inscription

L'inscription est confirmée après réception d'un acompte de 10% du montant de la formation. Le solde est réglé selon les modalités communiquées à l'inscription.

Retours d'expérience

Avis de nos anciens stagiaires

★★★★★

"Formation de qualité qui présente les dernières technologies du monde du Big Data, en combinant théorie et surtout pratique. Elle est animée par un formateur pédagogue et patient, qui maîtrise parfaitement son sujet et parvient à transmettre les informations avec aisance. Je recommande fortement cette formation."

A.
Ancien stagiairePromotion Big Data
★★★★★

"Je recommande vivement cette formation et je remercie le formateur pour son professionnalisme et la qualité du contenu. Ce que j'ai le plus apprécié, c'est d'avoir pu faire des exercices pratiques et un projet final sur un environnement Big Data distribué — un avantage qu'on ne trouve pas dans les cours en ligne. J'ai aussi bien compris l'écosystème Hadoop, ainsi que les différences et similarités entre les différentes technologies du Big Data, leurs avantages, leurs inconvénients et leurs cas d'usage, ce qui m'a permis de comprendre l'architecture globale."

B.
Ancienne stagiairePromotion Big Data
★★★★★

"Une très bonne formation, très riche, j'ai beaucoup appris. Merci au formateur pour sa pédagogie et sa patience. Je recommande vivement cette formation."

C.
Ancienne stagiairePromotion Big Data
Prochaine session

Réservez votre place dès maintenant

Places limitées à 10 participants. Laissez-nous vos coordonnées pour être recontacté rapidement.

Discuter sur WhatsApp