> Markdown version of [/jobs/ext/2380312-conception-et-mise-en-oeuvre-d-un-protocole-d-entrainement-d-un-llm-medical-francais](https://www.wearedevelopers.com/jobs/ext/2380312-conception-et-mise-en-oeuvre-d-un-protocole-d-entrainement-d-un-llm-medical-francais). Every page supports `.md` or `Accept: text/markdown`. Links point to the HTML versions so they work for humans too. Agent guide: [/agents.md](https://www.wearedevelopers.com/agents.md). --- # Conception et mise en oeuvre d'un protocole d'entraînement d'un LLM médical français - **Company:** Inria - **Location:** Paris, France (Remote available) - **Experience:** Starter - **Contract:** Temporary contract - **Skills:** Python (Programming Language), Large Language Models, Generative AI - **Published:** August 26, 2026 - **Apply:** https://fr.indeed.com/viewjob?jk=a3904371b25d6102 ## About the Role Compétences techniques et niveau requis : * excellente maîtrise des techonologies liées aux LLM, en particulier sur leurs entraînements (Continual Pre-Training, Supervised Fine-Tuning, Reinforcement Learning, Distillation, ...) et évaluations, avec la pratique des bibliothèques Python associées * bonne connaissance des données médicales * expérience préliminaire dans l'utilisation de plateformes de calcul sécurisées, avec de plus une sensibilisation aux aspects liés à la confidentialité des données Langues : français, anglais si possible Compétences relationnelles : capacité à interargir avec de nombreux partenaires dans un cadre pluri-disciplinaire (informatique/IA et médical) Compétences additionnelles appréciées ## Description En relation avec les membres de l'équipe ALMANACH (plus particulièrement Éric de la Clergerie), et en interaction avec les partenaires médicaux, la personne recrutée devra définir un protocole précis pour l'entraînement du modèle médical, avec en premier lieu le choix d'un modèle initial dont l'entraînement sera prolongé (par exemple un modèle QWEN 3.* 30 milliards de paramètres) et ensuite les modes optimaux d'exploitation des données cliniques (en continual pretraining ou instruction tuning par exemple). Des essais préliminaires seront conduits sur des données non confidentielles (données publiques, fictives, ...) pour une évaluation préliminaire des points clés de ce protocole. Ce travail devrait conduire à une bibliothèque de code exploitable pour démarrer l'entraînement à grande échelle. Dès que ce protocole sera bien établi et que des données cliniques seront disponibles sur l'instrastructure sécurisée de calcul, la personne recrutée sera en charge de lancer et monitorer l'entraînement sur celles-ci, en réalisant les adaptations nécessaires si besoin., * veille sur les développpements rapides en IA génératives pour (a) sélectionner le meilleur LLM pouvant servir de base pour le modèle médical et (b) les modes d'entraînement adaptés (probablement à base d'instructions sous forme de tâches) * conception de tâches pouvant en particulier être synthétisées à partir de dossiers patient * évaluation à petite échelle des divers modes d'entraînement sur des données non confidentielles * à partir de ces évaluations, conception d'une bibliothèque de code pouvant facilement être déployée au sein de l'infrastructure sécurisée de calcul. * recensement de jeux de données pour l'évaluation du modèle, soit existant en français, soit par traduction, soit par distillation à partir de LLM médicaux existants * mise en oeuvre initiale de l'entraînement du modèle médical une fois les données cliniques disponibles au sein de l'infrastructure sécurisée, La personne recrutée doit être passionnée par les développements de l'IA générative (LLM) et leurs applications sociétales, ici dans le domaine de la santé qui soulève divers défis (confidentialité des données, extrême techinicité des documents médicaux, ...). Elle doit être prête à interagir avec un public divers (informaticiens IA, experts médicaux, gestionaires d'infrastructure, ...). Elle doit également savoir se tenir au courant et prendre en compte des évolutions très rapides dans le domaine de l'IA générative. ## Related Videos - [Creating Industry ready solutions with LLM Models](https://www.wearedevelopers.com/videos/899-creating-industry-ready-solutions-with-llm-models) - [Inside the Mind of an LLM](https://www.wearedevelopers.com/videos/1617-inside-the-mind-of-an-llm) - [Your imaginations is (no longer) the limit: how Generative AI empowers people to be creative](https://www.wearedevelopers.com/videos/741-your-imaginations-is-no-longer-the-limit-how-generative-ai-empowers-people-to-be-creative) - [CUDA in Python](https://www.wearedevelopers.com/videos/1294-cuda-in-python) - [Lies, Damned Lies and Large Language Models](https://www.wearedevelopers.com/videos/1231-lies-damned-lies-and-large-language-models) - [Bringing the power of AI to your application.](https://www.wearedevelopers.com/videos/1010-bringing-the-power-of-ai-to-your-application) ## Related Articles - [What Are Large Language Models?](https://www.wearedevelopers.com/magazine/304-what-are-large-language-models) - [The Best Large Language Models on The Market](https://www.wearedevelopers.com/magazine/319-the-best-large-language-models-on-the-market) - [A 5-Step Open-Source Setup for Agentic Engineering](https://www.wearedevelopers.com/magazine/738-a-5-step-open-source-setup-for-agentic-engineering) - [From Prototype to Production: Build AI Agents with This Free 4-Course Learning Path](https://www.wearedevelopers.com/magazine/655-from-prototype-to-production-build-ai-agents-with-this-free-4-course-learning-path) - [MLops – Deploying, Maintaining And Evolving Machine Learning Models in Production](https://www.wearedevelopers.com/magazine/115-mlops-deploying-maintaining-and-evolving-machine-learning-models-in-production) - [MLOps – What’s the deal behind it?](https://www.wearedevelopers.com/magazine/125-mlops-what-s-the-deal-behind-it)