DES RESSOURCES ET DES OUTILS AU SERVICE DES ACTEURS ET DES PROFESSIONNELS.

Python sur Spark avec Databricks

Date de mise à jour : 22/11/2024 | Identifiant OffreInfo : 15_691493

Information fournie par :
Carif-Oref Occitanie

Objectifs, programme, validation de la formation

Objectifs

Maîtriser la librairie PySpark afin d'utiliser Apache Spark avec le langage de programmation Python sur un environnement Databricks.

Programme de la formation

- Présentation de DatabricksCette introduction permet de vous initier à l'environnement Databricks et ses outils

  • Historique
  • Différence entre l'utilisation Administrateur et Utilisateur
  • Comment mettre en place un projet sur Databricks/AWS
  • Comment créer un cluster de calcul avec Databricks/AWS
  • Gestion des notebooks, des utilisateurs et des ressources

- Introduction à SparkSpark est un environnement de travail distribué qui permet d'effectuer des calculs sur des gros volumes de données
  • Rappels sur le Big Data
  • Présentation de Spark: Spark RDD, Spark SQL, Spark MLlib, Spark GraphX
  • Configurer un Spark Context et une Spark Session
  • Gestion de la mémoire sous Spark

- Présentation de PySpark et l'API Pyspark RDDPyspark est l'API Python de Spark
  • Présentation de Pyspark et fonctionnement avec les Java Virtual Machines
  • Présentation de l'API Pyspark RDD et manipulation de données non structurées
  • Mise en pratique avec des fichiers textes (comptage de mots, nettoyage d'un fichier texte structuré) et avec des opérations d'agrégation sur PairRDDs

- Utilisation de l'API Pyspark SQLL'API Pyspark SQL permet de manipuler des données structurées sous format de Dataframes avec du Python et du SQL
  • Présentation de l'API Pyspark SQL
  • Lecture de fichiers csv, json, parquet et sauvegarde de fichier
  • Nettoyage et manipulation de données
  • Groupby et agrégation
  • Jointure de tables
  • Lien entre SQL et Python
  • Manipulation d'objets Row, et Window
  • Manipulation de dates
  • Utilisation de User Defined Function et de Pandas User Defined functions
  • Présentation de Pyspark Pandas
  • Nombreuses mises en pratique sur des jeux de données

- Introduction au Machine LearningRappels des fondamentaux du Machine Learning
  • Qu'est-ce que le Machine Learning? Apprentissages supervisé et non supervisé
  • Compromis Biais Variance
  • Modèles Linéaires
  • Modèles Non Linéaires
  • Modèles ensemblistes
  • Modèles de clustering
  • Métriques et évaluation des performances

- Machine Learning avec PySparkLes librairies associées à Pyspark MLlib permettent de faire tourner des modèles de Machine Learning dans un environnement de calcul distribué

    Validation et sanction

    Attestation de formation

    Type de formation

    Non certificiante

    Sortie

    Sans niveau spécifique

Métiers visés

Code Rome

Durée, rythme, financement

Modalités pédagogiques
Durée
35 heures en centre, 35 heures hebdomadaires

Conventionnement : Non

Financeur(s)

Autre

Conditions d'accès

Public(s)
Tout public
Modalités de recrutement et d'admission

Niveau d'entrée : Sans niveau spécifique

Conditions spécifiques et prérequis

Pour suivre ce stage dans de bonnes conditions, il est recommandé d'avoir suivi en amont la formation<a href="https://www.datavalue.fr/formation-python-bases-introduction-librairies-scientifiques" target="_blank" rel="">Python – Bases et introduction aux librairies scientifiquesou d'avoir atteint par la pratique un niveau équivalent

Modalités d'accès

Lieu de réalisation de l'action

Formation entièrement à distance
Adresse
Responsable :
Téléphone fixe :
Contacter l'organisme

Contacts

Contact sur la formation
Responsable : Monsieur Cédric CALAS
Téléphone fixe :
fax :
Site web :
Contacter l'organisme
Contacter l'organisme formateur
Data Value
SIRET: 81837224500014
31676 Labège
Responsable :
Téléphone fixe : 0972567567
Site web :
Contacter l'organisme

Période prévisibles de déroulement des sessions

du 01/01/2025 au 31/07/2026
débutant le : 01/01/2025
Adresse d'inscription
41 rue de la Découverte
CS 37621
31676 - Labège
Etat du recrutement : Ouvert
Modalités : Entrées/sorties permanentes

Organisme responsable

Data Value
SIRET : 81837224500014

Adresse
41 rue de la Découverte
CS 37621
31676 - Labège
Téléphone fixe : 0972567567
Contacter l'organisme