Paris, France · Disponible à partir de décembre 2026

Mamoudou WONE

AI Engineer · Data Scientist · Data Engineer

Je conçois des solutions data et IA, du traitement des données jusqu'au développement de modèles et d'applications intelligentes.

PythonSQLGCPBigQueryMachine LearningLLMReact
01

À propos

Ingénieur en formation à Centrale Lyon et Centrale Casablanca (double-diplôme), je me positionne à l'intersection de l'IA, de la Data Science et du Data Engineering. Je construis des pipelines de données, j'entraîne et j'évalue des modèles de machine learning, et j'intègre des LLM dans des applications complètes, du backend au produit déployé. En stage chez Fifty-Five, j'applique cette rigueur d'ingénierie à des problématiques de tracking, de conformité et de Marketing Mix Modeling sur BigQuery et l'écosystème Google Cloud.

Formation actuelle

École Centrale de Lyon

IA & Informatique

09/2025 – 09/2026

Langues

  • FrançaisC1
  • AnglaisB2

Centres d'intérêt

  • Slam (expression orale et créative)
  • Football
02

Formation

09/2025 – 09/2026

École Centrale de Lyon

France

Diplôme d'ingénieur (niveau Master)

IA & Informatique

Machine LearningDeep LearningNLPVision par ordinateurBig Data

09/2023 – 09/2026

École Centrale Casablanca

Maroc

Diplôme d'ingénieur

Ingénierie des systèmes (double-diplôme)

StatistiquesOptimisationMachine LearningRecherche opérationnelle

2025

ESSEC Business School

Rabat, Maroc

Semestre d'échange académique

Entrepreneuriat, Innovation, Stratégie d'entreprise

03

Compétences

AI & Machine Learning

PythonMachine LearningDeep LearningNLPComputer VisionScikit-learnPyTorchXGBoostHugging Face TransformersLLMRAGLangChainPrompt EngineeringOpenAI API

Data Engineering

PythonSQLPostgreSQLpgvectorChromaDBFAISSAlembicPipelines de donnéesTraitement de données à grande échelle

Cloud

Google Cloud PlatformBigQueryLooker Studio

Development

Next.jsReactTypeScriptTailwind CSSFastAPIStreamlitDockerGitCI/CD (GitHub Actions)pytestElasticsearch
04

Projets

Les projets les plus aboutis sont placés en premier ; tous sont présentés de la même façon.

Voice Invoice AI

Application de facturation qui transforme une commande dictée à l'oral en facture structurée. Le backend transcrit l'audio (API OpenAI), en extrait les articles via un LLM, les rapproche du catalogue produit via un moteur de correspondance hybride, puis génère une facture avec export PDF.

  • Moteur de correspondance produit en cascade : correspondance exacte → alias → floue (RapidFuzz) → similarité sémantique par embeddings (pgvector, text-embedding-3-small), avec index HNSW pour la recherche vectorielle en base
  • Authentification complète en production : JWT, vérification d'email, réinitialisation de mot de passe, révocation de sessions (token_version), verrouillage de compte après échecs répétés, rate limiting par IP stocké en base (pas en mémoire)
FastAPISQLAlchemyAlembicPostgreSQLpgvectorNext.js

AI Architecture Reviewer

Outil d'analyse automatique de repos GitHub publics : clonage, extraction de métriques de code (sans IA, pour limiter les coûts), résumé de chaque fichier et classement des findings via GPT-4o mini, génération d'un schéma d'architecture visuel (Mermaid).

  • Tracking précis des coûts tokens/USD à chaque analyse (exemple réel : $0.0066 pour 38 fichiers)
  • 26 tests avec l'API OpenAI mockée (zéro coût de test)
PythonFastAPIOpenAI GPT-4o miniMermaid.jspytestruff

Finance ChatBot — Assistant IA sur documents PDF (RAG)

Backend FastAPI + frontend Streamlit pour uploader, indexer et interroger des documents PDF financiers. Extraction et chunking des PDF (pdfplumber), embeddings via l'API Cohere, indexation vectorielle dans ChromaDB, métadonnées dans PostgreSQL. Recherche avec filtres (document, pages, tags) et réponses sourcées.

  • Extraction et chunking des PDF financiers (pdfplumber)
  • Indexation vectorielle ChromaDB + métadonnées PostgreSQL
PythonFastAPIStreamlitChromaDBPostgreSQLCohere

LearnWise — Assistant d'apprentissage IA 100 % local

Application permettant de créer des cours, y déposer des documents (PDF/DOCX/TXT) et interagir avec leur contenu via une IA entièrement locale (aucun appel à une API externe type OpenAI) : chat contextuel RAG, génération de quiz, flashcards interactives corrigées par l'IA, résumé de texte.

  • Approche privacy-first : modèle microsoft/phi-3-mini-4k-instruct exécuté en local via transformers
  • Embeddings sentence-transformers + index FAISS local
FastAPIPostgreSQLSQLAlchemyNext.jsTypeScriptFAISS

PingPong Video Platform

Plateforme d'analyse vidéo de matchs de ping-pong : streaming vidéo avec HTTP Range Requests (seek instantané), gestion de clips par set/point, recherche full-text Elasticsearch (fuzzy matching, filtres), chatbot IA avec RAG (Elasticsearch + OpenAI).

  • Streaming vidéo avec HTTP Range Requests (seek instantané)
  • Gestion de clips par set/point
FastAPINext.jsTypeScriptElasticsearchOpenAI APIDocker

Détection de fraude — Machine Learning

Traitement d'un dataset de ~590 000 transactions (434 variables), avec seulement 3,5 % de fraudes. Sélection de variables par corrélation, réduction de dimension (ACP), entraînement et comparaison de 4 modèles (Random Forest, XGBoost, SVM, KNN) avec GridSearchCV. Comparaison de 5 techniques de rééquilibrage des classes (Under/Over Sampling, Tomek Links, SMOTE, SMOTE-Tomek).

  • Comparaison de 4 modèles (Random Forest, XGBoost, SVM, KNN) avec GridSearchCV
  • Comparaison de 5 techniques de rééquilibrage des classes
PythonScikit-learnXGBoostimbalanced-learnPandas

Prédiction du churn client

Classification sur le dataset Telco Customer Churn (7 043 clients, 20 variables démographiques, contractuelles et comportementales). EDA complète, encodage OneHotEncoder, comparaison de 7 modèles avec GridSearchCV, puis étude de l'arbitrage précision/rappel entre données brutes et données rééquilibrées.

  • EDA complète : distribution des classes, analyse des variables numériques par densité (ancienneté, charges mensuelles/totales)
  • Comparaison de 7 modèles (Random Forest, Gradient Boosting, SVM, Régression Logistique, KNN, Decision Tree, AdaBoost) avec GridSearchCV
PythonScikit-learnimbalanced-learn (SMOTEENN)PandasSeaborn

Optimisation par descente de gradient stochastique

Implémentation from scratch (NumPy, sans scikit-learn) de trois algorithmes d'optimisation — SGD, Mini-Batch Gradient Descent et Adam — pour une régression linéaire, avec variantes régularisées (Ridge/L2) de chacun. Projet de groupe.

  • Comparaison de la vitesse de convergence : Mini-Batch converge en ~21 itérations contre ~66 pour Adam et ~149 pour le SGD pur, pour un MSE final similaire
  • Étude de la robustesse au bruit sur données synthétiques à trois niveaux croissants (écart-type 1, 4, 10)
PythonNumPyMatplotlib

Segmentation d'image par Chaînes de Markov Cachées (HMC)

Projet académique de recherche : segmentation non supervisée d'images en niveaux de gris via un modèle de chaîne de Markov cachée, estimé par l'algorithme EM et décodé par le critère MPM. Conversion image 2D → signal 1D par parcours de Peano/courbe de Hilbert (préservation du voisinage des pixels). Comparaison avec Otsu et KMeans.

  • Estimation par algorithme EM et décodage par critère MPM
  • Conversion image 2D → signal 1D par parcours de Peano/courbe de Hilbert
PythonNumPySciPyMatplotlib
05

Expérience professionnelle

06/2026 – 12/2026

Data Scientist ConsultantFifty Five

Stage de fin d'études (en cours)
Parisen cours

  • Exploitation de BigQuery et de l'écosystème GCP pour l'agrégation et le nettoyage de données de tracking
  • Dashboards Looker Studio pour le monitoring de la conformité cookies d'un client
  • Contribution à un modèle de Marketing Mix Modeling (MMM)
  • Requêtes SQL avancées au service de la data quality et du suivi des problématiques de tracking

04/2025 – 07/2025

Stagiaire Data & IAD&A Technologies

IA générative
Maroc

  • Outil de génération automatique de tableaux de bord à partir de requêtes en langage naturel (NLP)
  • Pipeline de traitement de données (extraction, nettoyage, structuration JSON)

09/2024 – 01/2025

Consultant innovationKey Mystery

Analyse de données
Maroc

  • Analyses exploratoires (EDA) et KPI/dashboards pour appuyer les décisions stratégiques de clients
  • Segmentation client et recommandations data-driven

06/2024 – 08/2024

Stagiaire développement webAutohall

Digitalisation
Maroc

  • Digitalisation de processus internes avec structuration des données utilisateurs
  • Démarche Agile
06

Contact

Construisons quelque chose d'intelligent.

Une opportunité, une question, ou juste envie d'échanger sur un projet ? N'hésite pas à m'écrire.

Recherche un poste en CDI en Data Science / IA / Machine Learning à partir de décembre 2026