Machine Learning & Data Science
Prédiction du churn client
Classification sur le dataset Telco Customer Churn (7 043 clients, 20 variables démographiques, contractuelles et comportementales). EDA complète, encodage OneHotEncoder, comparaison de 7 modèles avec GridSearchCV, puis étude de l'arbitrage précision/rappel entre données brutes et données rééquilibrées.
Points forts
- EDA complète : distribution des classes, analyse des variables numériques par densité (ancienneté, charges mensuelles/totales)
- Comparaison de 7 modèles (Random Forest, Gradient Boosting, SVM, Régression Logistique, KNN, Decision Tree, AdaBoost) avec GridSearchCV
- Sur données brutes : meilleure accuracy avec AdaBoost/Random Forest (~81 %), mais rappel limité (~55-57 %) sur la classe minoritaire (clients résiliant)
- Après rééquilibrage (SMOTEENN) : rappel à 75-85 % au prix d'une accuracy plus faible (~70-72 %) — arbitrage pertinent puisque manquer un client qui résilie coûte plus cher qu'une fausse alerte
Stack technique
PythonScikit-learnimbalanced-learn (SMOTEENN)PandasSeaborn