Machine learning avec scikit-learn

Le machine learning, c'est moins une affaire d'algorithme que de bonne question, et de ne pas se mentir sur la réponse. On parcourt toute la chaîne avec scikit-learn, du tableau brut au modèle fiable, sauvegardé et exposé derrière une API.

Durée : 3 jours · Niveau : intermédiaire

Pour qui : les analystes, scientifiques et développeurs souhaitant ajouter le machine learning à leur boîte à outils.

Prérequis : être à l'aise avec Python et pandas.

Machine learning with scikit-learn

Jour 1 — Poser le problème

  • Ce que le machine learning peut, et ne peut pas, faire pour vous
  • Poser le problème : supervisé, non supervisé, que prédire
  • Features, cible et l'API scikit-learn : fit, predict, transform
  • Découper ses données : entraînement et test
  • Première régression : les modèles linéaires
  • Mesurer l'erreur : MAE, RMSE, R²
  • Première classification : régression logistique, k plus proches voisins
  • L'accuracy ment : matrice de confusion, précision, rappel, F1
  • Arbres de décision et forêts aléatoires

Jour 2 — Faire les choses bien

  • Surapprentissage et sous-apprentissage : le compromis biais/variance
  • La validation croisée
  • Feature engineering : normaliser, encoder, valeurs manquantes
  • Tout enchaîner avec les pipelines et ColumnTransformer
  • Régler les hyperparamètres par grid et random search
  • Les classes déséquilibrées
  • Éviter les fuites de données
  • Regrouper sans étiquettes : le clustering avec k-means
  • Réduire les dimensions avec la PCA

Jour 3 — Vers la production

  • Interpréter un modèle : importance des features et permutation
  • Sauver et charger ses modèles avec joblib et skops
  • Servir des prédictions derrière une API web
  • Surveiller un modèle qui vieillit
  • Un mot sur le gradient boosting : XGBoost, LightGBM
  • Un mot sur le deep learning : quand scikit-learn ne suffit plus
  • Un projet de bout en bout sur vos données

Passez au niveau supérieur en Python !