1 – PYTHON POUR LA DATA SCIENCE
- Utilisation de modules
- Liste des méthodes d’un module
- Création de modules personnalisés
- List comprehension
- Dictionary comprehension
- String comprehension
- Python 2 vs Python 3
- Sets (Python 3+)
- Idiomes Python
- L’« écosystème » Data Science de Python
- NumPy
- Tableaux NumPy
- Idiomes NumPy
- pandas
- Data wrangling avec le DataFrame de pandas
- SciPy
- Scikit-learn
- SciPy ou scikit-learn ?
- Matplotlib
- Python vs R
- Python sur Apache Spark
- Outils de développement Python et REPL
- Anaconda
- IPython
- Visual Studio Code
- Jupyter
- Commandes de base de Jupyter
- Résumé
2 – DATA SCIENCE APPLIQUÉE
- Qu’est-ce que la data science ?
- Écosystème de la data science
- Data mining vs data science
- Business analytics vs data science
- Data science, machine learning, IA ?
- Qui est data scientist ?
- Diagramme de Venn des compétences en data science
- Les data scientists au travail
- Exemples de projets de data science
- Exemple de produit de données
- Data science appliquée chez Google
- Pièges en data science
- Résumé
3 – PHASES DU CYCLE DE VIE DE L’ANALYSE DE DONNÉES
- Pipeline d’analyse Big Data
- Phase de découverte des données (Data Discovery)
- Phase de collecte des données (Data Harvesting)
- Phase de préparation des données (Data Priming)
- Logistique des données et gouvernance des données
- Analyse exploratoire des données
- Phase de planification du modèle
- Phase de création du modèle
- Communication des résultats
- Déploiement en production
- Résumé
4 – CORRIGER ET NORMALISER LES DONNÉES
- Correction et normalisation des données
- Gestion des données manquantes
- Jeu de données d’exemple
- Récupération d’informations sur les données nulles
- Suppression d’une colonne
- Interpolation des données manquantes dans pandas
- Remplacement des valeurs manquantes par la moyenne
- Mise à l’échelle (normalisation) des données
- Prétraitement des données avec scikit-learn
- Mise à l’échelle avec la fonction scale()
- L’objet MinMaxScaler
- Résumé
5 – CALCUL DE STATISTIQUES DESCRIPTIVES EN PYTHON
- Statistique descriptive
- Asymétrie d’une distribution de probabilité
- Utilisation de NumPy pour calculer des indicateurs statistiques descriptifs
- Détermination du minimum et du maximum avec NumPy
- Utilisation de pandas pour calculer des indicateurs statistiques descriptifs
- Corrélation
- Régression et corrélation
- Covariance
- Détermination des indicateurs de corrélation et de covariance par paires
- Détermination du minimum et du maximum dans un DataFrame pandas
- Résumé
6 – AGRÉGATION ET GROUPEMENT DES DONNÉES
- Agrégation et groupement des données
- Jeu de données d’exemple
- L’objet pandas.core.groupby.SeriesGroupBy
- Groupement selon deux colonnes ou plus
- Reproduction de la clause WHERE de SQL
- Tableaux croisés dynamiques
- Tabulation croisée
- Résumé
7 – VISUALISATION DES DONNÉES AVEC MATPLOTLIB
- Visualisation des données
- Qu’est-ce que matplotlib ?
- Premiers pas avec matplotlib
- La fenêtre de tracé
- Les options Figure
- La fonction matplotlib.pyplot.plot()
- La fonction matplotlib.pyplot.bar()
- La fonction matplotlib.pyplot.pie()
- Subplots
- Utilisation de l’objet matplotlib.gridspec.GridSpec
- La fonction matplotlib.pyplot.subplot()
- Exercice pratique
- Figures
- Enregistrement de figures dans un fichier
- Visualisation avec pandas
- Utilisation de matplotlib dans des Jupyter Notebooks
- Résumé
8 – ALGORITHMES DE DATA SCIENCE ET DE ML DANS SCIKIT-LEARN
- Data science, machine learning, IA ?
- Types de machine learning
- Terminologie : features et observations
- Features continues et catégorielles (variables)
- Terminologie : axe
- Le package scikit-learn
- Estimators scikit-learn
- Modèles, estimators et predictors
- Métriques de distance courantes
- La métrique euclidienne
- Le format LIBSVM
- Mise à l’échelle des features
- La malédiction de la dimensionnalité
- Machine learning supervisé vs non supervisé
- Algorithmes de machine learning supervisé
- Algorithmes de machine learning non supervisé
- Choix du bon algorithme
- Cycles de vie du développement en machine learning
- Répartition des données en jeux d’entraînement et de test
- Répartition des données dans scikit-learn
- Exercice pratique
- Exemples de classification
- Classification avec k-Nearest Neighbors (SL)
- Algorithme k-Nearest Neighbors
- Le taux d’erreur
- Exercice pratique
- Réduction de dimensionnalité
- Les avantages de la réduction de dimensionnalité
- Analyse en composantes principales (ACP)
- Exercice pratique
- Data blending
- Arbres de décision (SL)
- Terminologie des arbres de décision
- Classification par arbres de décision dans le contexte de la théorie de l’information
- Définition de l’entropie de l’information
- La formule de l’entropie de Shannon
- L’algorithme simplifié des arbres de décision
- Utilisation des arbres de décision
- Random forests
- SVM
- Classificateur naïf bayésien (SL)
- Le modèle probabiliste naïf bayésien en bref
- Formule de Bayes
- Classification de documents avec Naive Bayes
- Type d’apprentissage non supervisé : le clustering
- Exemples de clustering
- Clustering k-means (UL)
- Le clustering k-means en bref
- Caractéristiques de k-means
- Analyse de régression
- Modèle de régression linéaire simple
- Régression linéaire vs non linéaire
- Illustration de la régression linéaire
- Principales hypothèses sous-jacentes de l’analyse de régression
- Méthode des moindres carrés (MMC)
- Régression linéaire pondérée localement
- Modèles de régression dans Excel
- Analyse de régression multiple
- Régression logistique
- Régression vs classification
- Analyse de séries temporelles
- Décomposition de séries temporelles
- Résumé
9 – EXERCICES PRATIQUES (LABS)
- Lab 1 – Découverte de l’environnement de lab
- Lab 2 – Utilisation de Jupyter Notebook
- Lab 3 – Correction et normalisation des données
- Lab 4 – Calcul de statistiques descriptives
- Lab 5 – Groupement et agrégation des données
- Lab 6 – Visualisation des données avec matplotlib
- Lab 7 – Répartition des données
- Lab 8 – Algorithme k-Nearest Neighbors
- Lab 9 – L’algorithme k-means
- Lab 10 – L’algorithme random forest