Python pour le big data
Date de mise à jour :
Identifiant Offre Info : 03_2205286F
Organisme responsable :
Data Value
(ouvre dans un nouvel onglet)
Présentation de la formation
Objectifs
Utiliser le langage Python pour manipuler et visualiser de grands ensembles de données (big data) en exploitant ses nombreuses librairies scientifiques
Programme de la formation
- Concepts du Big Data Cette introduction permet de vous initier à la problématique du Big Data Volume, Vitesse, Véracité Map Reduce Architecture Big Data et Data Lake Big Data et Cloud computing Les outils du Big Data - Introduction à la librairie Dask Dask est une librairie qui permet de faire du calcul distribué sur plusieurs cœurs ou plusieurs machines avec la possibilité d'utiliser un scheduler. Dask peut donc accélérer le calcul sur de larges volumes de données.…
- Cette introduction permet de vous initier à la problématique du Big Data
- Volume, Vitesse, Véracité
- Map Reduce
- Architecture Big Data et Data Lake
- Big Data et Cloud computing
- Les outils du Big Data
- Dask est une librairie qui permet de faire du calcul distribué sur plusieurs cœurs ou plusieurs machines avec la possibilité d'utiliser un scheduler. Dask peut donc accélérer le calcul sur de larges volumes de données.
- Présentation de Dask
- Exemple de calculs distribués
- Dask et Numpy : comparaison de performances
- Dask et Pandas
- Xarray est une librairie Python qui s'appuie sur Numpy et permet de manipuler de larges volumes de données. Cette librairie est particulièrement efficace pour des fichiers netCDF et peut s'utiliser de concert avec Dask
- Présentation de Xarray
- Exemples d'utilisation de Xarray
- Mise en pratique avec un fichier netCDF
- Vaex est une librairie qui ressemble beaucoup à pandas mais qui fait des calculs à la volée sans gaspiller l'usage de la RAM. On peut dès lors traiter des données qui ont près de 1 milliard de lignes à la seconde.
- Présentation de Vaex
- Prise en main de Vaex avec des exemples
- Comparaison entre Vaex et Pandas
- Visualisation des données avec Vaex
- Spark est un outil permettant le passage à l'échelle pour la gestion des données et le calcul distribué. Bien que géré par Apache, Spark est en Open Source et peut s'utiliser avec plusieurs langages dont Python
- Présentation de Spark
- Architecture Apache Spark
- Autres outils associés à Spark (Yarn, Mesos)
- Resilient Distributed Dataset (RDD)
- Présentation et Installation de PySpark
- Vous verrez grâce une mise en pratique sur une journée la prise en main de PySpark, comment lire et gérer des données, comment appliquer des fonctions sur les données et comment appliquer une réduction de dimension
- Manipuler des gros volumes de données n'est pas toujours suffisants, on veut pouvoir aussi les visualiser. La librairie Holoviews permet aussi bien de transformer des données massives que de les visualiser.
- Présentation et prise en main d'Holoviews
- Interactivité avec Holoviews
Validation et sanction
- Connaître les différentes librairies Python permettant de manipuler le Big Data
- Savoir manipuler de grands volumes de données
- Avoir des notions sur l'architecture Big Data
Type de formation
Non certifiante
Niveau de sortie
Sans niveau spécifique
Durée, rythme, financement
Modalités pédagogiques
Pédagogie active mêlant exposés, exercices et applications pratiques dans le logiciel Python.
Durée
En centre
35 h
Financement
- Conventionnement
- Non
- Financeurs
-
- Bénéficiaire de l'action
- Entreprise
Conditions d'accès
Publics visés
- Salarié
- Tout public
Informations sur les publics
Architectes, développeurs, data scientists, chefs de projet, ...
Niveau d'entrée
Sans niveau spécifique
Conditions spécifiques et prérequis
Pour suivre ce stage dans de bonnes conditions, il est recommandé d'avoir suivi en amont la formation Python – Bases et introduction aux librairies scientifiques ou d'avoir atteint par la pratique un niveau équivalent.
Lieu de réalisation de l'action
Modalités d'enseignement
Formation entièrement en présentielle
Adresse
33 Rue de la République69002 Lyon 2e
Responsable : ASI
Périodes prévisibles de déroulement des sessions
Début
Fin
- Adresse d'inscription
-
41 rue de la Découverte
31676 Labège - État du recrutement
- Ouvert
- Modalités
- Entrées / Sorties à dates fixes