Senior Ai - Llm Engineer - IA Générative & Agentique Rag Fine-Tuning Inférence H/F

Prad
Inconnu, France
15 days ago
Apply on www.hellowork.com
Prepare application

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience level
Expert
Experience required
3 years minimum
Working hours
Regular working hours

Tech stack

Artificial Intelligence Python (Programming Language) Performance Tuning Large Language Models Generative AI Fastapi Kubernetes Decoding

Job description

Concevoir, fine-tuner et améliorer des pipelines RAG et agentiques en production

  • Travailler sur l’inférence de modèles : déploiement de LLMs sur GPU (vLLM), optimisation latence / débit / coûts

  • Mettre en place l’évaluation et l’observabilité des pipelines IA (Phoenix/Arize, DSPy) : datasets d’évaluation, métriques de qualité, boucles d’amélioration continue

  • Améliorer en continu la qualité d’extraction et les performances des agents

  • Partager vos connaissances et coacher les profils moins expérimentés, Des produits GenAI réellement en production, dans un environnement exigeant et à fort impact

  • Une stack à l’état de l’art : vLLM, LangGraph, Google ADK, DSPy, Phoenix (Arize)

  • Un vrai mandat technique : du delivery, pas des slides

  • L’opportunité d’apporter un regard neuf à une équipe qui investit sérieusement dans l’IA

STACK : Python, vLLM, LangGraph, Google ADK, DSPy, Phoenix (Arize), FastAPI, Kubernetes

PROCESSUS DE RECRUTEMENT

Entretien en présentiel (Paris), incluant des tests de mathématiques et de Python. Références techniques vérifiées.

Requirements

Profil recherché1) 5 ans d’expérience minimum, dont au moins 3 ans en entreprise sur des sujets agentique, RAG, IA générative2) Compréhension profonde du fonctionnement des LLMs (architecture transformer, attention, tokenisation, décodage, quantization) - capable de l’expliquer et de le démontrer3) Expérience concrète de l’inférence en production : vLLM, GPU, optimisation de performances4) Pratique du fine-tuning (SFT, LoRA/QLoRA) et de l’amélioration de systèmes RAG en production5) Solides bases en mathématiques et Python (testées en entretien présentiel)6) Références techniques vérifiables, 1) 5 ans d’expérience minimum, dont au moins 3 ans en entreprise sur des sujets agentique, RAG, IA générative

2) Compréhension profonde du fonctionnement des LLMs (architecture transformer, attention, tokenisation, décodage, quantization) - capable de l’expliquer et de le démontrer

3) Expérience concrète de l’inférence en production : vLLM, GPU, optimisation de performances

4) Pratique du fine-tuning (SFT, LoRA/QLoRA) et de l’amélioration de systèmes RAG en production

5) Solides bases en mathématiques et Python (testées en entretien présentiel)

6) Références techniques vérifiables

EUR

Intelligence artificielle Kubernetes Optimisation des performances Python

Senior Ai - Llm Engineer - IA Générative & Agentique Rag Fine-Tuning Inférence H/F

About the company

Vous rejoignez la division IA d’une grande banque d’investissement européenne, au sein de la plateforme CIB. L’équipe Data Science conçoit et délivre des produits IA déjà en production : extraction automatisée de données à partir de documents financiers, chatbot agentique et génération de données. Ces produits sont utilisés au quotidien par les équipes métiers - vos améliorations ont un impact direct et mesurable.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.hellowork.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

3:33 min

Connecting frontends via a FastAPI proxy backend layer

Saoussen Chaabnia Saoussen Chaabnia · Europe 2026 Virtual

2:23 min

Evaluating video encoding formats for faster decoding

Magne Johansen Magne Johansen · Europe 2026 Virtual

2:28 min

Understanding Kubernetes architecture and core cluster components

Marc Nimmerrichter · World Congress 2022

2:37 min

Optimizing technical profiles for AI sourcing and recruitment

Mina Golesorkhi Mina Golesorkhi · World Congress 2026 Europe

1:42 min

Introduction to the fast API web framework

Sebastián Ramírez · World Congress 2022

3:22 min

Evaluating advanced artificial intelligence platforms for daily recruitment

Rudi Bauer Rudi Bauer +1 · Cappuccino with HR

Videos

See all

Related articles

See all