Machine Learning & Data Science
Détection de fraude — Machine Learning
Traitement d'un dataset de ~590 000 transactions (434 variables), avec seulement 3,5 % de fraudes. Sélection de variables par corrélation, réduction de dimension (ACP), entraînement et comparaison de 4 modèles (Random Forest, XGBoost, SVM, KNN) avec GridSearchCV. Comparaison de 5 techniques de rééquilibrage des classes (Under/Over Sampling, Tomek Links, SMOTE, SMOTE-Tomek).
Points forts
- Comparaison de 4 modèles (Random Forest, XGBoost, SVM, KNN) avec GridSearchCV
- Comparaison de 5 techniques de rééquilibrage des classes
- Meilleur résultat : XGBoost + Random Undersampling, 81 % precision / 69 % recall sur la classe fraude
Stack technique
PythonScikit-learnXGBoostimbalanced-learnPandas