lp.boitel

00 — Introduction

Léo-Paul Boitel.

Ingénieur IA freelance à Paris. Agents, RAG, serveurs MCP, Machine Learning et pipelines de données — de l’idée jusqu’à la production.

Lille → Toulouse → Hong Kong → Paris
Disponible ·

Lire l’histoire

Prologue

Depuis cinq ans, j'ai le même crédo:  partir d’un problème flou, de données en désordre, pour en faire un outil que quelqu’un utilise vraiment, le lundi matin.

Chapitre 01

2021

Les bases

Lille, France
50.63° N — 3.06° E

Tout commence dans le Nord, en école d’ingénieurs. Machine learning, deep learning, NLP, vision : j’y apprends les outils. La recherche appliquée m’apprend le reste — la rigueur.

  • Formation

    IMT Nord Europe — ex-Télécom Lille · Mines de Douai

    Diplôme d’ingénieur en informatique et data science, spécialisation data science et recherche appliquée : machine learning, deep learning, NLP, vision par ordinateur, traitement du signal.

  • Mars – août 2021

    Worldline — Assistant ingénieur R&D

    Premiers pas en R&D industrielle : contribution à un article de recherche sur l’authentification comportementale — reconnaître un utilisateur à sa manière d’interagir plutôt qu’à son mot de passe.

Chapitre 02

2022—25

Le terrain

Toulouse, France
43.60° N — 1.44° E

Trois ans de conseil en data science. Des clients exigeants, de nombreux domaines : l’emploi, le sport pro, la santé, le secteur public, le Web3.

C’est là que j’apprends la leçon la plus importante du métier : le modèle n’est jamais la partie la plus difficile. Le vrai travail, c’est tout ce qu’il y a autour — collecter, nettoyer, industrialiser, faire adopter.

The Blockchain Group — Data Scientist 2022 – 2025
02.1

Alfacentre

Emploi · Secteur public

Cartographier le marché de l’emploi, une offre à la fois.

Fine-tuning de Llama 3 8B pour extraire les compétences des offres d’emploi, normalisation vers des référentiels standards et classification dans plus de 400 catégories métiers. Industrialisé de bout en bout, de la collecte des offres jusqu’à l’intégration en base, sur plusieurs environnements.

120K+offres traitées chaque année — impossible à faire à la main
  • Llama 3 8B
  • Fine-tuning
  • MageAI
  • PostgreSQL
  • AWS GPU
  • GitLab
02.2

Metadev3

Web3

Automatiser la veille sur les exchanges décentralisés.

Une application RAG qui collecte la documentation du plus grand nombre possible de DEX, en extrait automatiquement les critères clés et les classe. Scraping, embeddings et inférence LLM — avec l’encadrement d’un stagiaire et le pilotage du projet.

2–3 sem.de recherche gagnées au lancement de chaque projet, pour une équipe de 5 ingénieurs
  • RAG
  • OpenAI API
  • Embeddings
  • Gradio
  • Docker
02.3

Racing Club Toulonnais

Sport professionnel

Aider un club de rugby pro à décider avant le coup d’envoi.

Une plateforme d’aide à la décision stratégique : pipelines d’intégration pour centraliser de gros volumes de données (API vers Elastic), et modèles de machine learning pour anticiper les blessures des joueurs (CIM-10) et optimiser la stratégie avant les matchs.

  • Machine learning
  • Elastic
  • APIs
  • Python
02.4

DILA

Secteur public

Anonymiser des textes à l’échelle du big data.

Pilotage d’un projet d’anonymisation : état de l’art complet des solutions de pseudonymisation de textes en français, puis développement d’un pipeline big data combinant Transformers et expressions régulières.

  • NLP
  • Transformers
  • Regex
  • Big data

Et aussi

CHIVA / Maestria
Reporting et dataviz pour des hôpitaux d’Occitanie, outils de suivi des stocks et des ventes (Superset, PostgreSQL, MariaDB, Docker).
CCI Île-de-France
Optimisation de cas d’usage métier et étude stratégique sur l’adoption de l’IA (OpenAI, Copilot) : faisabilité technique et ROI.
Esov
Étude de faisabilité d’une récupération de mot de passe décentralisée, par cryptographie, pour des applications Web3.
CoachIQ
Plateforme web et mobile d’optimisation de la performance sportive.

Chapitre 03

2024—25

Transmettre

Université Toulouse Capitole
43.61° N — 1.43° E

En parallèle des missions, on me confie le module de Data Mining d’un Master 2. Deux années de suite.

Concevoir les cours, animer les travaux pratiques, encadrer les projets : accompagner les étudiants de la théorie jusqu’au code, avec les outils qu’ils retrouveront en entreprise. Expliquer un algorithme à une salle entière reste le meilleur moyen de vérifier qu’on l’a vraiment compris.

100étudiants encadrés
2promotions consécutives

Chapitre 04

2025—26

Hong Kong

Hong Kong
22.32° N — 114.17° E

Nouveau continent, nouvelle échelle. Je rejoins la banque d’investissement, au cœur de missions d’audit internationales — un monde où il ne suffit pas qu’un modèle fonctionne : il faut pouvoir le démontrer.

Société Générale CIB — Data Scientist Sept. 2025 – sept. 2026
04.1

Outil interne

Audit · Finance

Un outil de Gap Analysis, du prototype au déploiement.

Conçu, développé et déployé en interne : une architecture qui combine RAG et knowledge graphs, orchestrée avec LangChain, pour outiller l’analyse d’écarts des équipes.

  • RAG
  • Knowledge graphs
  • LangChain
  • Python
  • Audit

    Missions internationales

    Pilotage du volet data de missions d’audit internationales.

  • Formation

    Ateliers internes

    Conception et animation d’ateliers de montée en compétences en data science et en Python.

Chapitre 05

Le soir

Le laboratoire

localhost
127.0.0.1

Chapitre 06

2026

Aujourd’hui

Paris, France
48.86° N — 2.35° E

Retour à Paris, à mon compte. Ingénieur IA freelance, j’aide les équipes à faire passer leurs projets d’IA de la démo à la production.

  • Agents & orchestration multi-agents

    Des agents qui raisonnent, appellent des outils et se coordonnent — avec un humain dans la boucle quand il le faut.

  • Serveurs MCP & intégrations

    Brancher les LLM sur vos données et vos outils métiers, proprement et de façon maîtrisée.

  • RAG & knowledge graphs

    Faire parler une base documentaire, avec des réponses sourcées et vérifiables.

  • Data engineering

    Pipelines ETL, modélisation, qualité de données : les fondations sans lesquelles aucun modèle ne tient.

  • Industrialisation

    Du notebook à la production : APIs, Docker, CI/CD, cloud AWS et Azure.

Disponible pour de nouvelles missions Me contacter →

Bilan

Cinq ans, en quelques chiffres.

120K+

offres d’emploi analysées chaque année par un pipeline industrialisé

400+

catégories métiers couvertes par les modèles de classification

2–3 sem.

de recherche économisées au lancement de chaque projet Web3

100

étudiants de Master 2 formés au data mining

Annexe

La boîte à outils.

IA & LLM

  • Claude API · Claude Code
  • MCP
  • LangChain · LangGraph
  • RAG · Knowledge graphs
  • Fine-tuning LLM
  • PyTorch · Hugging Face

Data

  • Python
  • SQL · PostgreSQL
  • Elastic
  • MageAI · n8n
  • Superset
  • Pipelines ETL

Production

  • Docker
  • AWS · Azure
  • CI/CD · GitLab
  • FastAPI
  • Git

Web

  • TypeScript
  • React · Vue.js
  • Node.js
  • Gradio
FrançaisNatif
EnglishCourant · TOEIC 975
EspañolAvancé
РусскийA2 · autodidacte
日本語N5 · autodidacte

Épilogue

Le prochain chapitre s’écrit avec vous.

Un agent à mettre en production, un RAG qui patine, un pipeline de données à fiabiliser — ou simplement l’envie d’en parler ? Écrivez‑moi.