Text mining
Date de mise à jour :
Identifiant Offre Info : 03_2205289F
Organisme responsable :
Data Value
(ouvre dans un nouvel onglet)
Présentation de la formation
Objectifs
Il peut s'agir de textes littéraires, scientifiques (bibliométrie, recherche documentaire), économiques, sociologiques (réponses aux questions ouvertes dans des enquêtes socio-économiques, entretiens divers en marketing, psychologie appliquée, pédagogie, médecine), de textes historiques, politiques…
Programme de la formation
- Introduction Présentation de l'analyse statistique textuelle Domaines d'application Exemples d'utilisation Présentation du logiciel de traitement - Importation des données Les diverses natures et sources de données textuelles utilisables Procédures d'importation selon la nature des données Exemples d'importation - Codification : du texte brut au tableau statistique Données textuelles et données contextuelles Création du tableau lexical : la…
- Présentation de l'analyse statistique textuelle
- Domaines d'application
- Exemples d'utilisation
- Présentation du logiciel de traitement
- Les diverses natures et sources de données textuelles utilisables
- Procédures d'importation selon la nature des données
- Exemples d'importation
- Données textuelles et données contextuelles
- Création du tableau lexical : la création des documents
- Prétraitement des données textuelles (mise en forme, lemmatisation)
- Dictionnaire des termes
- Calcul de la fréquence de mots : identifier les termes ou concepts les plus récurrents
- Bilan lexical par document, par variable de contexte
- Table de dissimilarité entre documents ou entre modalités de variable contexte
- Spécificités : termes sur- ou sous-représentés dans une modalité d'une variable de contexte
- Co-occurrences : termes spécifiques des documents qui contiennent un terme donné.
- Contexte dans lequel un mot est cité, permet d'éclairer le sens du texte
- Nuage de mots (« word_cloud »)
- Permet de révéler le sens profond des données textuelles et de synthétiser l'information contenue dans les données
- Analyse factorielle des correspondances (examen multidimensionnel du lien des termes entre eux, avec les documents et avec les variables de contexte)
- Classification ascendante hiérarchique des documents en groupes homogènes au regard des termes et des variables de contexte
Validation et sanction
- Connaître les étapes de qualification et de formatage des données brutes en vue d'y appliquer les méthodes d'analyse statistique
- Mener une analyse descriptive du texte (fréquence des mots, bilan lexical, table de dissimilarité, co-occurences, nuage de mots,….)
- Approfondir l'analyse au moyen de techniques multidimensionnelles
Type de formation
Non certifiante
Niveau de sortie
Sans niveau spécifique
Durée, rythme, financement
Modalités pédagogiques
La présentation alterne exposés et illustrations par des applications en grandeur réelle, choisies dans des domaines divers, industriels et socio-économiques.
Durée
En centre
21 h
Financement
- Conventionnement
- Oui
- Financeurs
-
- Bénéficiaire de l'action
- Entreprise
Conditions d'accès
Publics visés
- Salarié
- Tout public
Informations sur les publics
Toute personne travaillant sur des données de type texte et désirant exploiter au mieux les méthodes statistiques exploratoires.
Niveau d'entrée
Sans niveau spécifique
Conditions spécifiques et prérequis
Pour suivre ce stage dans de bonnes conditions, il est recommandé d'avoir suivi en amont la formation statistique descriptive (exploratoire) : savoir décrire des observations ou d'avoir atteint par la pratique un niveau équivalent
Lieu de réalisation de l'action
Modalités d'enseignement
Formation entièrement en présentielle
Adresse
33 Rue de la République69002 Lyon 2e
Responsable : ASI
Périodes prévisibles de déroulement des sessions
Début
Fin
- Adresse d'inscription
-
41 rue de la Découverte
31676 Labège - État du recrutement
- Ouvert
- Modalités
- Entrées / Sorties à dates fixes