Python pour la data science
Date de mise à jour :
Identifiant Offre Info : 14_AF_0000249728
Organisme responsable :
Stat4decision
(ouvre dans un nouvel onglet)
Présentation de la formation
Objectifs
- Maîtriser les bases de python
- Etre capable d'analyser des données avec python
- Etre capable d'automatiser le traitement de données avec python
- Connaître les outils pour la data science de python
Programme de la formation
Jour 1 - Python aujourd'hui : bases et bonnes pratiques Introduction au langage python Pour qui ? Pour quoi faire ? Comment ? Les consoles et le débogage en python Le langage (la syntaxe, les structures (string, listes, dictionnaires…), les opérateurs et les fonctions) Les classes, les objets et la création de bibliothèques Jour 2 – Manipulation et préparation des données avec pandas Importation de données CSV, Excel Fichiers texte Bases de données (SQL –…
- Introduction au langage python
- Pour qui ? Pour quoi faire ? Comment ?
- Les consoles et le débogage en python
- Le langage (la syntaxe, les structures (string, listes, dictionnaires…), les opérateurs et les fonctions)
- Les classes, les objets et la création de bibliothèques
- Importation de données
- CSV, Excel
- Fichiers texte
- Bases de données (SQL – principes, exemples)
- Données issues du web (API, scraping léger)
- Manipulation de données avec pandas
- DataFrame : concepts fondamentaux
- Sélection, filtrage, tri
- Création et transformation de variables
- Jointures et concaténations
- Gestion des données manquantes
- Préparation des données pour l'analyse
- Nettoyage et contrôles de qualité
- Typage des variables
- Variables catégorielles
- Travail sur les dates et les données textuelles
- Agrégations (groupby, pivots)
- Automatisation des traitements
- Principes de la data visualisation
- Pourquoi visualiser ?
- Erreurs classiques
- Choisir le bon graphique pour la bonne question
- Visualisation avec matplotlib & seaborn
- Histogrammes, boxplots, scatter plots
- Comparaison de groupes
- Visualisations multivariées
- Personnalisation minimale mais lisible
- Analyse exploratoire (EDA)
- Lire une distribution
- Détecter des anomalies
- Comprendre des relations entre variables
- Interpréter sans sur-interpréter
- Visualisation interactive (ou dashboards légers)
- Introduction aux visualisations interactives
- Atelier : exploration visuelle complète d'un jeu de données
- Comprendre le machine learning (sans jargon inutile)
- Apprentissage supervisé / non supervisé
- Régression vs classification
- Sur-apprentissage, biais, variance
- Importance de la validation
- Préparation des données pour le ML
- Séparation train / test
- Standardisation et encodage
- Pipelines avec scikit-learn
- Cas pratiques de machine learning
- Régression (prévision, scoring)
- Classification simple
- Clustering (k-means, segmentation)
- Industrialisation et bonnes pratiques
Validation et sanction
Type de formation
Non certifiante
Niveau de sortie
Sans niveau spécifique
Durée, rythme, financement
Modalités pédagogiques
Formation en salle de classe virutelle
Durée
En centre
28 h
Financement
- Conventionnement
- Non
Conditions d'accès
Public visé
- Tout public
Niveau d'entrée
Sans niveau spécifique
Conditions spécifiques et prérequis
Connaissances de base en traitement de données (statistique et tables de données) Pas de prérequis en python
Lieu de réalisation de l'action
Modalités d'enseignement
Formation entièrement à distance
Adresse
Périodes prévisibles de déroulement des sessions
Début
Fin
- Adresse d'inscription
-
Stat4decision
75012 Paris 12e - État du recrutement
- Ouvert
- Modalités
- Entrées / Sorties à dates fixes