Conception et mise en oeuvre d'un protocole d'entraînement d'un LLM médical français

Inria
Paris, France
about 1 month ago
Apply on fr.indeed.com
Prepare application

Role details

Contract type
Temporary contract
Employment type
Part-time (≤ 32 hours)
Experience level
Starter
Working hours
Regular working hours
Languages
English, French
Job source

Tech stack

Python (Programming Language) Large Language Models Generative AI

Job description

En relation avec les membres de l’équipe ALMANACH (plus particulièrement Éric de la Clergerie), et en interaction avec les partenaires médicaux, la personne recrutée devra définir un protocole précis pour l’entraînement du modèle médical, avec en premier lieu le choix d’un modèle initial dont l’entraînement sera prolongé (par exemple un modèle QWEN 3.* 30 milliards de paramètres) et ensuite les modes optimaux d’exploitation des données cliniques (en continual pretraining ou instruction tuning par exemple).

Des essais préliminaires seront conduits sur des données non confidentielles (données publiques, fictives, …) pour une évaluation préliminaire des points clés de ce protocole. Ce travail devrait conduire à une bibliothèque de code exploitable pour démarrer l’entraînement à grande échelle.

Dès que ce protocole sera bien établi et que des données cliniques seront disponibles sur l’instrastructure sécurisée de calcul, la personne recrutée sera en charge de lancer et monitorer l’entraînement sur celles-ci, en réalisant les adaptations nécessaires si besoin., * veille sur les développpements rapides en IA génératives pour (a) sélectionner le meilleur LLM pouvant servir de base pour le modèle médical et (b) les modes d’entraînement adaptés (probablement à base d’instructions sous forme de tâches)

  • conception de tâches pouvant en particulier être synthétisées à partir de dossiers patient
  • évaluation à petite échelle des divers modes d’entraînement sur des données non confidentielles
  • à partir de ces évaluations, conception d’une bibliothèque de code pouvant facilement être déployée au sein de l’infrastructure sécurisée de calcul.
  • recensement de jeux de données pour l’évaluation du modèle, soit existant en français, soit par traduction, soit par distillation à partir de LLM médicaux existants
  • mise en oeuvre initiale de l’entraînement du modèle médical une fois les données cliniques disponibles au sein de l’infrastructure sécurisée, La personne recrutée doit être passionnée par les développements de l’IA générative (LLM) et leurs applications sociétales, ici dans le domaine de la santé qui soulève divers défis (confidentialité des données, extrême techinicité des documents médicaux, …). Elle doit être prête à interagir avec un public divers (informaticiens IA, experts médicaux, gestionaires d’infrastructure, …). Elle doit également savoir se tenir au courant et prendre en compte des évolutions très rapides dans le domaine de l’IA générative.

Requirements

Compétences techniques et niveau requis :

  • excellente maîtrise des techonologies liées aux LLM, en particulier sur leurs entraînements (Continual Pre-Training, Supervised Fine-Tuning, Reinforcement Learning, Distillation, …) et évaluations, avec la pratique des bibliothèques Python associées
  • bonne connaissance des données médicales
  • expérience préliminaire dans l’utilisation de plateformes de calcul sécurisées, avec de plus une sensibilisation aux aspects liés à la confidentialité des données

Langues : français, anglais si possible

Compétences relationnelles : capacité à interargir avec de nombreux partenaires dans un cadre pluri-disciplinaire (informatique/IA et médical)

Compétences additionnelles appréciées

Benefits & conditions

  • Restauration subventionnée
  • Transports publics remboursés partiellement
  • Congés: 7 semaines de congés annuels + 10 jours de RTT (base temps plein) + possibilité d’autorisations d’absence exceptionnelle (ex : enfants malades, déménagement)
  • Possibilité de télétravail et aménagement du temps de travail
  • Équipements professionnels à disposition (visioconférence, prêts de matériels informatiques, etc.)
  • Prestations sociales, culturelles et sportives (Association de gestion des œuvres sociales d’Inria)
  • Accès à la formation professionnelle
  • Sécurité sociale, Sécurité défense : Ce poste est susceptible d’être affecté dans une zone à régime restrictif (ZRR), telle que définie dans le décret n°2011-1425 relatif à la protection du potentiel scientifique et technique de la nation (PPST). L’autorisation d’accès à une zone est délivrée par le chef d’établissement, après avis ministériel favorable, tel que défini dans l’arrêté du 03 juillet 2012, relatif à la PPST. Un avis ministériel défavorable pour un poste affecté dans une ZRR aurait pour conséquence l’annulation du recrutement.

Politique de recrutement : Dans le cadre de sa politique diversité, tous les postes Inria sont accessibles aux personnes en situation de handicap.

About the company

Contexte et atouts du poste

Cette proposition de poste s’inscrit dans le cadre du projet FG4H financé par la BPI, projet qui a vocation à développer un grand modèle de langue (LLM) spécialisé pour le domaine médical français, en s’appuyant sur plusieurs millions de dossiers patients fournis par les partenaires du projets.

Pour des raisons de confidentialités des données, l’entraînement et la validation de ce modèle prendra place au sein d’une infrastructure sécurisée, ce qui pose des contraintes fortes.

La personne retenue sera un acteur majeur dans la définition du protocole d’entraînement et de mise en oeuvre initiale de ce protocole, en coordination avec les partenaires du projet et en fonction des contraines liées à l’infrastructure de calcul., Inria, l’institut national de recherche dans les sciences et technologies du numérique, est en appui de l’État pour les stratégies nationales de recherche et d’innovation du numérique en tant qu’Agence de programmes. Inria mène plus de 300 projets de recherche et d’innovation avec ses 3500 scientifiques, ingénieurs et personnels d’appui, en partenariat avec les universités et l’écosystème numérique (entreprises, entrepreneurs, acteurs publics). Ensemble, nous explorons des domaines clés comme l’intelligence artificielle, la cybersécurité, l’informatique quantique, le Cloud, la transformation numérique de la santé, les jumeaux numériques ou encore les technologies numériques pour la défense. Nous construisons des solutions concrètes telles que des logiciels, des startups technologiques, des partenariats avec les entreprises du tissu national et des formations de pointe. Notre objectif : l’impact scientifique, technologique et industriel au service de la souveraineté numérique de la France.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on fr.indeed.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

2:37 min

Tracing the evolution from early AI to generative AI

Mike Mike · World Congress 2025

3:32 min

Fundamentals and limitations of large language models

Krzystof Czieslak · LIVE

1:17 min

Fabricated software updates for Python alongside lunar quarantine proposals

Chris Heilmann Chris Heilmann +1 · LIVE

2:08 min

Applying large language models to infrastructure tasks

Alfonso Sandoval Rosas Alfonso Sandoval Rosas · Europe 2026 Virtual

2:14 min

Introduction to generative AI and content warnings

Cheuk Ho · World Congress 2023

1:59 min

Building culturally aware LLMs for global audiences

Werner Vogels Werner Vogels +1 · World Congress 2026 Europe

Videos

See all

Related articles

See all