Retour aux projets

Machine Learning & Data Science

Détection de fraude — Machine Learning

Traitement d'un dataset de ~590 000 transactions (434 variables), avec seulement 3,5 % de fraudes. Sélection de variables par corrélation, réduction de dimension (ACP), entraînement et comparaison de 4 modèles (Random Forest, XGBoost, SVM, KNN) avec GridSearchCV. Comparaison de 5 techniques de rééquilibrage des classes (Under/Over Sampling, Tomek Links, SMOTE, SMOTE-Tomek).

Points forts

Stack technique

PythonScikit-learnXGBoostimbalanced-learnPandas
Voir sur GitHub