Course ID: #PYTH-DS

Python With Data Science

Duration: 2 jours Dates: 19 octobre 2026 18 janvier 2027 19 avril 2027 19 juillet 2027

Ce cours aborde les aspects théoriques et techniques de l’utilisation de Python dans des projets de data science appliquée et dans des cas d’usage de logistique des données.

1 – PYTHON POUR LA DATA SCIENCE

  • Utilisation de modules
  • Liste des méthodes d’un module
  • Création de modules personnalisés
  • List comprehension
  • Dictionary comprehension
  • String comprehension
  • Python 2 vs Python 3
  • Sets (Python 3+)
  • Idiomes Python
  • L’« écosystème » Data Science de Python
  • NumPy
  • Tableaux NumPy
  • Idiomes NumPy
  • pandas
  • Data wrangling avec le DataFrame de pandas
  • SciPy
  • Scikit-learn
  • SciPy ou scikit-learn ?
  • Matplotlib
  • Python vs R
  • Python sur Apache Spark
  • Outils de développement Python et REPL
  • Anaconda
  • IPython
  • Visual Studio Code
  • Jupyter
  • Commandes de base de Jupyter
  • Résumé

2 – DATA SCIENCE APPLIQUÉE

  • Qu’est-ce que la data science ?
  • Écosystème de la data science
  • Data mining vs data science
  • Business analytics vs data science
  • Data science, machine learning, IA ?
  • Qui est data scientist ?
  • Diagramme de Venn des compétences en data science
  • Les data scientists au travail
  • Exemples de projets de data science
  • Exemple de produit de données
  • Data science appliquée chez Google
  • Pièges en data science
  • Résumé

3 – PHASES DU CYCLE DE VIE DE L’ANALYSE DE DONNÉES

  • Pipeline d’analyse Big Data
  • Phase de découverte des données (Data Discovery)
  • Phase de collecte des données (Data Harvesting)
  • Phase de préparation des données (Data Priming)
  • Logistique des données et gouvernance des données
  • Analyse exploratoire des données
  • Phase de planification du modèle
  • Phase de création du modèle
  • Communication des résultats
  • Déploiement en production
  • Résumé

4 – CORRIGER ET NORMALISER LES DONNÉES

  • Correction et normalisation des données
  • Gestion des données manquantes
  • Jeu de données d’exemple
  • Récupération d’informations sur les données nulles
  • Suppression d’une colonne
  • Interpolation des données manquantes dans pandas
  • Remplacement des valeurs manquantes par la moyenne
  • Mise à l’échelle (normalisation) des données
  • Prétraitement des données avec scikit-learn
  • Mise à l’échelle avec la fonction scale()
  • L’objet MinMaxScaler
  • Résumé

5 – CALCUL DE STATISTIQUES DESCRIPTIVES EN PYTHON

  • Statistique descriptive
  • Asymétrie d’une distribution de probabilité
  • Utilisation de NumPy pour calculer des indicateurs statistiques descriptifs
  • Détermination du minimum et du maximum avec NumPy
  • Utilisation de pandas pour calculer des indicateurs statistiques descriptifs
  • Corrélation
  • Régression et corrélation
  • Covariance
  • Détermination des indicateurs de corrélation et de covariance par paires
  • Détermination du minimum et du maximum dans un DataFrame pandas
  • Résumé

6 – AGRÉGATION ET GROUPEMENT DES DONNÉES

  • Agrégation et groupement des données
  • Jeu de données d’exemple
  • L’objet pandas.core.groupby.SeriesGroupBy
  • Groupement selon deux colonnes ou plus
  • Reproduction de la clause WHERE de SQL
  • Tableaux croisés dynamiques
  • Tabulation croisée
  • Résumé

7 – VISUALISATION DES DONNÉES AVEC MATPLOTLIB

  • Visualisation des données
  • Qu’est-ce que matplotlib ?
  • Premiers pas avec matplotlib
  • La fenêtre de tracé
  • Les options Figure
  • La fonction matplotlib.pyplot.plot()
  • La fonction matplotlib.pyplot.bar()
  • La fonction matplotlib.pyplot.pie()
  • Subplots
  • Utilisation de l’objet matplotlib.gridspec.GridSpec
  • La fonction matplotlib.pyplot.subplot()
  • Exercice pratique
  • Figures
  • Enregistrement de figures dans un fichier
  • Visualisation avec pandas
  • Utilisation de matplotlib dans des Jupyter Notebooks
  • Résumé

8 – ALGORITHMES DE DATA SCIENCE ET DE ML DANS SCIKIT-LEARN

  • Data science, machine learning, IA ?
  • Types de machine learning
  • Terminologie : features et observations
  • Features continues et catégorielles (variables)
  • Terminologie : axe
  • Le package scikit-learn
  • Estimators scikit-learn
  • Modèles, estimators et predictors
  • Métriques de distance courantes
  • La métrique euclidienne
  • Le format LIBSVM
  • Mise à l’échelle des features
  • La malédiction de la dimensionnalité
  • Machine learning supervisé vs non supervisé
  • Algorithmes de machine learning supervisé
  • Algorithmes de machine learning non supervisé
  • Choix du bon algorithme
  • Cycles de vie du développement en machine learning
  • Répartition des données en jeux d’entraînement et de test
  • Répartition des données dans scikit-learn
  • Exercice pratique
  • Exemples de classification
  • Classification avec k-Nearest Neighbors (SL)
  • Algorithme k-Nearest Neighbors
  • Le taux d’erreur
  • Exercice pratique
  • Réduction de dimensionnalité
  • Les avantages de la réduction de dimensionnalité
  • Analyse en composantes principales (ACP)
  • Exercice pratique
  • Data blending
  • Arbres de décision (SL)
  • Terminologie des arbres de décision
  • Classification par arbres de décision dans le contexte de la théorie de l’information
  • Définition de l’entropie de l’information
  • La formule de l’entropie de Shannon
  • L’algorithme simplifié des arbres de décision
  • Utilisation des arbres de décision
  • Random forests
  • SVM
  • Classificateur naïf bayésien (SL)
  • Le modèle probabiliste naïf bayésien en bref
  • Formule de Bayes
  • Classification de documents avec Naive Bayes
  • Type d’apprentissage non supervisé : le clustering
  • Exemples de clustering
  • Clustering k-means (UL)
  • Le clustering k-means en bref
  • Caractéristiques de k-means
  • Analyse de régression
  • Modèle de régression linéaire simple
  • Régression linéaire vs non linéaire
  • Illustration de la régression linéaire
  • Principales hypothèses sous-jacentes de l’analyse de régression
  • Méthode des moindres carrés (MMC)
  • Régression linéaire pondérée localement
  • Modèles de régression dans Excel
  • Analyse de régression multiple
  • Régression logistique
  • Régression vs classification
  • Analyse de séries temporelles
  • Décomposition de séries temporelles
  • Résumé

9 – EXERCICES PRATIQUES (LABS)

  • Lab 1 – Découverte de l’environnement de lab
  • Lab 2 – Utilisation de Jupyter Notebook
  • Lab 3 – Correction et normalisation des données
  • Lab 4 – Calcul de statistiques descriptives
  • Lab 5 – Groupement et agrégation des données
  • Lab 6 – Visualisation des données avec matplotlib
  • Lab 7 – Répartition des données
  • Lab 8 – Algorithme k-Nearest Neighbors
  • Lab 9 – L’algorithme k-means
  • Lab 10 – L’algorithme random forest
Solution d’apprentissage

Blended Learning, Firmenseminar, Individualcoaching, Klassenraumtraining, Online Live Webinar

Langue

Deutsch, Englisch, Französisch, Italienisch

Dates

2026/10/19, 2027/01/18, 2027/04/19, 2027/07/19, flexibel, auf Anfrage

Lieu

Brüttisellen, Lausanne, flexibel, auf Anfrage

NumPy, pandas, Matplotlib, scikit-learn ; REPL Python ; Jupyter Notebooks ; phases du cycle de vie de l’analyse de données ; correction et normalisation des données ; agrégation et groupement des données ; visualisation des données ; algorithmes de data science pour le machine learning supervisé et non supervisé.

Data scientists, développeurs de logiciels, architectes informatiques et cadres techniques. Les participants doivent disposer de connaissances générales en statistique et en programmation, et être familiarisés avec Python.

Plage de prix : CHF1'600 à CHF6'800 hors TVA

Effacer

S’INSCRIRE

Newsletter

Recevez par e-mail les dernières informations sur les nouvelles formations, offres et actions.

← Retour

Merci pour votre réponse. ✨

Email Subscription
Gestion des processus et de la qualité
Amazon