Révèle la puissance sémantique des modèles de langage et adapte l’IA générative aux cas d’usage métier
Dans le cadre du développement stratégique de ses solutions avancées de traitement automatique du langage naturel, un grand compte recherche un(e) NLP / LLM Scientist. Ton rôle sera central et à forte valeur scientifique : tu concevras, adapteras et évalueras des modèles de langage de pointe (LLMs propriétaires et modèles ouverts) pour répondre aux défis métiers spécifiques du groupe avec un niveau d’exigence maximal sur la performance, la fiabilité et la reproductibilité.
Ton futur environnement
Tu évolueras au sein d’une équipe de recherche appliquée et d’ingénierie IA de premier plan, en collaboration étroite avec les data scientists, les ingénieurs MLOps et les directions métiers. Dans un environnement équipé d’infrastructures de calcul accéléré (GPU), tu travailleras sur des corpus textuels d’entreprise riches et volumineux. C’est le cadre parfait pour mener une veille scientifique de pointe, expérimenter des techniques d’adaptation paramétrique avancées (LoRA, QLoRA) et déployer des architectures RAG robustes.
Tes missions clés
Modélisation, Fine-Tuning & Architectures Génératives (Mode R&D & BUILD) :
-
Analyser, benchmarker et sélectionner les architectures de modèles de langage les plus adaptées aux cas d’usage (arbitrage modèles propriétaires vs modèles open-weight comme Llama ou Mistral).
-
Réaliser le fine-tuning et l’alignement de modèles ouverts sur des corpus métiers spécialisés en appliquant des techniques d’adaptation efficaces (PEFT, LoRA, QLoRA).
-
Concevoir et optimiser des stratégies de prompting avancées et des chaînes d’augmentation par récupération (RAG) connectées à des bases vectorielles.
-
Résoudre des problématiques de NLP classiques et génératives : extraction d’entités nommées (NER), classification sémantique, résumé automatique et recherche de similarité textuelle (spaCy, Hugging Face Transformers).
Évaluation Scientifique, Benchmarking & Restitution (Mode LAB & ÉVALUATION) :
-
Concevoir des jeux de données d’évaluation dédiés (benchmarks sur mesure) et formaliser des métriques quantitatives et qualitatives par tâche (précision, fidélité, consistance, BLEU/ROUGE, LLM-as-a-judge).
-
Analyser rigoureusement les erreurs, quantifier les phénomènes d’hallucination et calibrer les scores de confiance des modèles.
-
Assurer le suivi des expérimentations, le versioning des poids et des métriques via MLflow sur grappes GPU.
-
Rédiger la documentation méthodologique et restituer avec clarté les conclusions scientifiques auprès d’interlocuteurs techniques et de sponsors métiers.
Ton profil
-
Formation : Diplôme d’Ingénieur, Bac+5 universitaire (Master 2) ou Doctorat (PhD) en NLP, Machine Learning, informatique ou linguistique computationnelle.
-
Expérience : Tu justifies d’une expérience confirmée de 3 à 5 ans en NLP et Deep Learning appliqué au texte (ou doctorat avec travaux appliqués).
-
Expertise NLP & LLM Impérative :
-
Maîtrise approfondie de la programmation en Python et du framework PyTorch.
-
Excellente pratique de l’écosystème Hugging Face (Transformers, Datasets, PEFT, TRL).
-
Expérience concrète du fine-tuning de modèles de langage open-weight (LoRA, QLoRA, Mistral, Llama).
-
Solide compréhension des architectures RAG, des bases vectorielles et des bibliothèques NLP traditionnelles (spaCy).
-
Maîtrise des protocoles d’évaluation rigoureuse de modèles génératifs et de l’analyse des erreurs.
-
-
Culture d’Ingénierie & Outils :
-
Utilisation de MLflow pour le tracking d’expériences et pratique des environnements de calcul sur GPU.
-
Respect des bonnes pratiques de développement logiciel et de reproductibilité du code (Git).
-
-
Langues : Anglais professionnel opérationnel (lecture/rédaction de publications scientifiques).
Tes atouts
-
Rigueur Scientifique et Esprit Critique : Approche méthodique indispensable pour concevoir des protocoles d’évaluation impartiaux et traquer les faiblesses algorithmiques.
-
Excellence Rédactionnelle et Pédagogie : Capacité à synthétiser des concepts de recherche complexes et à vulgariser les résultats auprès de directions métiers.
-
Curiosité et Veille Active : Passion pour l’état de l’art mondial en NLP et rapidité d’assimilation des nouvelles techniques de modélisation.