Maîtriser la plateforme Databricks et Apache Spark pour l'ingénierie et l'analytique big data.
Objectifs pédagogiques :
- Prendre en main Databricks (workspaces, notebooks, Unity Catalog).
- Développer des jobs Spark structurés (Delta Lake, optimisations).
- Orchestrer, tester et industrialiser (Jobs, workflows, CI/CD).
Compétences visées :
- Spark/Delta
- Data Engineering
- Orchestration & CI/CD
- Gouvernance (Unity Catalog)
Prépare à la certification : Databricks & Spark — Traitement de données à grande échelle (DBX-DE) (Databricks).
Durée : 3 jour(s), soit 21 heures. Formation animée par un formateur expert du domaine, alternant apports théoriques et travaux pratiques. Programme adaptable aux besoins du commanditaire.
Module 1 — Fondamentaux Databricks (0,5 j)
Contenus :
- Workspace
- Repos
- Catalogues & permissions
Module 2 — Traitements Spark & Delta (1,5 j)
Contenus :
- Spark SQL & DataFrames
- OPTIMIZE, Z?ORDER
- Streaming
Module 3 — Industrialisation (1 j)
Contenus :
- Jobs/Workflows
- Tests & CI/CD
- Monitoring & coûts
Module 4 — MLflow et déploiement de modèles (0,5 jour)
Contenus :
- MLflow : tracking, registry, déploiement
- Serving des modèles sur Databricks
- Optimisation des pipelines ML
Activités :
- Lab : pipeline ML complet avec MLflow sur Databricks
Résultats attendus :
- Déployer et monitorer des modèles ML sur Databricks
Modalités d'évaluation : évaluation continue par travaux pratiques et quiz de fin de module. Une attestation de fin de formation précisant les acquis est remise à chaque stagiaire.
Attestation de formation
Non certifiante
Sans niveau spécifique