Résumé
Bridging the gap between mathematical theory and production-grade code. As a Dual…
Expériences professionnelles
Data scientist & ml engineer
opsci.ai , Rennes - CDD
De Décembre 2025 à Aujourd'hui
Responsable de l'industrialisation et de la mise en production des projets Data Science au sein du Scientific Data Space (SDS).
Missions Principales (Full Ownership) :
+ Computer Vision & MLOps (Objectif Prioritaire) :
- Conception de A à Z d'un pipeline complet de "Visual Mining" pour la détection sur images/vidéos (Cyberdéfense).
- Mise en production (Google Cloud / Vertex AI), et monitoring des performances.
+ NLP & Lutte contre la Désinformation :
- Maintenance et évolution des pipelines de Topic Modeling et Narratif Filtering.
- Intégration de LLMs Open Source pour l'analyse sémantique avancée.
+ Data Engineering & Stratégie :
- Définition du plan de collecte et structuration de la donnée (Data Collection Plan).
- Création de dashboards décisionnels (Metabase / Streamlit) pour les équipes d'analystes.
- Environnement Technique : Python, Google Cloud Platform (Vertex AI), Git, SQL, NLP (Spacy, HuggingFace), Computer Vision.
Data scientist & ml engineer
opsci.ai , Rennes - Stage
De Mai 2025 à Octobre 2025
Conception et déploiement d'un pipeline complet d'analyse sémantique sur Google Cloud (GCP).
+ NLP & Topic Modeling (De la R&D à la Prod) :
- Création d'un pipeline complexe : Collecte (APIs) → Embeddings → Clustering (UMAP/HDBSCAN) → Annotation via LLM (OpenAI).
- Impact : Production de 50+ analyses sur des corpus massifs pour des clients stratégiques.
+ Engineering & MLOps :
- Industrialisation sur GCP (Cloud Run / Functions) : Orchestration, flux Parquet/SQL, CI/CD et Monitoring.
- Déploiement pionnier de modèles LLM pour la classification thématique à coût optimisé.
+ Computer Vision (R&D) :
- Intégration de modèles SOTA (CLIP, DINO) pour le clustering et la recherche d'images à grande échelle.
- Interactions directes avec le C-Level (CTO/CEO) pour les recommandations techniques.
Data scientist intern
DIRECTION GENERALE DE L'AVIATION CIVILE , Paris cedex 15 - Stage
De Juin 2024 à Août 2024
1ʳᵉ note parmi tous les stages de l'ENSAI
En cours de transformation en article scientifique en collaboration avec un enseignant-chercheur basé au Canada.
Modélisation avancée du coefficient de Frottement Longitudinal (CFL) en lien avec les contaminants hivernaux (sous conditions hivernales : neige fraîche, neige compactée, glace, slush, etc)
Première mission :
Vérification de la qualité de la base de données (après le nettoyage classique) :
Variables explicatives : Définition des critères de stabilité et des seuils de validation de chaque observation.
Variable à expliquer : Étude de la reproductibilité et de la répétabilité des mesures du CFL de toutes les observations.
Deuxième mission :
Modélisation du CFL en fonction des variables explicatives pour chaque contaminant (8 contaminants= 8 modèles), par "une régression linéaire sous contrainte par morceaux pénalisée" pour des raisons d'interprétabilité (à la fin, un bon niveau d'interprétabilité et de prédictibilité est atteint), puis une modélisation "boîte noire" par le modèle des forêts aléatoires et du XGBoost pour améliorer la prédictibilité.
Troisième mission :
Étude de la relation inverse : classification des huit contaminants par rapport au CFL et son interaction avec d'autres variables explicatives.
Computer vision intern
Groupe COSUMAR , Casablanca - Stage
De Juin 2023 à Août 2023
Mise en place d’un modèle YOLO (You Only Look Once) de détection d’objets en temps réel visant La détection du port des EPI (Équipement de Protection Individuelle) pour les fonctionnaires de Cosumar dans la Supply Chain.
1. Collecte et Préparation des Données
Nous avons commencé from scratch, c'est-à-dire en recherchant, collectant et annotant les données nous-mêmes.
Outils utilisés : LabelImg et Roboflow pour l'annotation des images.
2. Modélisation et Entraînement
Nous avons opté pour un fine-tuning de YOLOv7, un modèle avancé de détection d’objets.
L'entraînement a nécessité des ressources computationnelles importantes.
Colab a été utilisé pour un accès limité au GPU.
Roboflow a ensuite été exploré pour optimiser le processus, offrant des outils comme :
Data augmentation avec sélection personnalisée des transformations.
Entraînement d’un modèle intermédiaire à utiliser comme checkpoint pour un autre modèle.
3. Résultats et Performances
Les performances obtenues après entraînement sont :
mAP (Mean Average Precision) : 83.7%
Précision : 87.7%
Recall : 78.0%