Analyse de données avec pandas

La vraie donnée arrive en retard, incomplète et éparpillée dans cinq formats. Cette formation suit tout le chemin, de la capture des données à la restitution graphique : charger, nettoyer, croiser et résumer avec pandas, puis faire parler les chiffres dans un graphique lisible par tous.

Durée : 3 jours · Niveau : intermédiaire

Pour qui : analystes, statisticiens, scientifiques et développeurs qui doivent explorer des données et en rendre compte.

Prérequis : connaître les bases de Python : types, boucles, fonctions.

Data analysis with pandas

Jour 1 — Charger et nettoyer

  • Jupyter et ses amis : un labo confortable
  • Series et DataFrame : les deux briques de base
  • Charger du CSV, de l'Excel, du JSON et du SQL
  • Regarder ses données avant de leur faire confiance
  • Sélectionner avec loc, iloc et les masques booléens
  • Corriger les types et les encodages
  • Données manquantes : les trouver, les combler ou les jeter
  • Doublons et valeurs aberrantes
  • Colonnes de texte avec l'accesseur str

Jour 2 — Faire parler les données

  • Dates, périodes et séries temporelles
  • Rééchantillonnage et fenêtres glissantes
  • Grouper et agréger avec groupby
  • Croiser les sources avec merge et join
  • Remodeler : pivot, melt, stack
  • Les données catégorielles
  • Appliquer ses propres fonctions, et pourquoi l'éviter
  • Le chaînage de méthodes pour des analyses lisibles
  • Statistiques descriptives

Jour 3 — Montrer les résultats

  • Des graphiques avec matplotlib
  • Graphiques statistiques avec seaborn
  • Graphiques interactifs avec plotly
  • Choisir le bon graphique pour le bon message
  • Exporter en Excel, CSV et parquet
  • Du notebook au script reproductible
  • Accélérer pandas : vectorisation et types
  • Un mot sur polars et duckdb
  • Atelier : de la capture des données à la restitution graphique

Passez au niveau supérieur en Python !