> Markdown version of [/jobs/ext/2107382-senior-ai-llm-engineer-ia-generative-agentique-rag-fine-tuning-inference-h-f](https://www.wearedevelopers.com/jobs/ext/2107382-senior-ai-llm-engineer-ia-generative-agentique-rag-fine-tuning-inference-h-f). Every page supports `.md` or `Accept: text/markdown`. Links point to the HTML versions so they work for humans too. Agent guide: [/agents.md](https://www.wearedevelopers.com/agents.md). --- # Senior Ai - Llm Engineer - IA Générative & Agentique Rag Fine-Tuning Inférence H/F - **Company:** Prad - **Location:** Inconnu, France - **Experience:** Expert - **Contract:** Permanent contract - **Skills:** Artificial Intelligence, Python (Programming Language), Performance Tuning, Large Language Models, Generative AI, Fastapi, Kubernetes, Decoding - **Published:** August 19, 2026 - **Apply:** https://www.hellowork.com/fr-fr/emplois/82434589.html ## About the Role Profil recherché1) 5 ans d'expérience minimum, dont au moins 3 ans en entreprise sur des sujets agentique, RAG, IA générative2) Compréhension profonde du fonctionnement des LLMs (architecture transformer, attention, tokenisation, décodage, quantization) - capable de l'expliquer et de le démontrer3) Expérience concrète de l'inférence en production : vLLM, GPU, optimisation de performances4) Pratique du fine-tuning (SFT, LoRA/QLoRA) et de l'amélioration de systèmes RAG en production5) Solides bases en mathématiques et Python (testées en entretien présentiel)6) Références techniques vérifiables, 1) 5 ans d'expérience minimum, dont au moins 3 ans en entreprise sur des sujets agentique, RAG, IA générative 2) Compréhension profonde du fonctionnement des LLMs (architecture transformer, attention, tokenisation, décodage, quantization) - capable de l'expliquer et de le démontrer 3) Expérience concrète de l'inférence en production : vLLM, GPU, optimisation de performances 4) Pratique du fine-tuning (SFT, LoRA/QLoRA) et de l'amélioration de systèmes RAG en production 5) Solides bases en mathématiques et Python (testées en entretien présentiel) 6) Références techniques vérifiables EUR Intelligence artificielle Kubernetes Optimisation des performances Python Senior Ai - Llm Engineer - IA Générative & Agentique Rag Fine-Tuning Inférence H/F ## Description Concevoir, fine-tuner et améliorer des pipelines RAG et agentiques en production - Travailler sur l'inférence de modèles : déploiement de LLMs sur GPU (vLLM), optimisation latence / débit / coûts - Mettre en place l'évaluation et l'observabilité des pipelines IA (Phoenix/Arize, DSPy) : datasets d'évaluation, métriques de qualité, boucles d'amélioration continue - Améliorer en continu la qualité d'extraction et les performances des agents - Partager vos connaissances et coacher les profils moins expérimentés, Des produits GenAI réellement en production, dans un environnement exigeant et à fort impact - Une stack à l'état de l'art : vLLM, LangGraph, Google ADK, DSPy, Phoenix (Arize) - Un vrai mandat technique : du delivery, pas des slides - L'opportunité d'apporter un regard neuf à une équipe qui investit sérieusement dans l'IA STACK : Python, vLLM, LangGraph, Google ADK, DSPy, Phoenix (Arize), FastAPI, Kubernetes PROCESSUS DE RECRUTEMENT Entretien en présentiel (Paris), incluant des tests de mathématiques et de Python. Références techniques vérifiées. ## Related Videos - [Understanding Kubernetes in a visual way](https://www.wearedevelopers.com/videos/100085-understanding-kubernetes-in-a-visual-way) - [Tour de Force: Open-Source LLM Inference Optimization from Simple to Sophisticated](https://www.wearedevelopers.com/videos/100099-tour-de-force-open-source-llm-inference-optimization-from-simple-to-sophisticated) - [Intro to FastAPI](https://www.wearedevelopers.com/videos/462-intro-to-fastapi) - [How to Avoid LLM Pitfalls - Mete Atamel and Guillaume Laforge](https://www.wearedevelopers.com/videos/1328-how-to-avoid-llm-pitfalls-mete-atamel-and-guillaume-laforge) - [Instant KAI Sandboxes with vCluster: Multi-Tenant, Multi-Scheduler GPU Sharing](https://www.wearedevelopers.com/videos/100333-instant-kai-sandboxes-with-vcluster-multi-tenant-multi-scheduler-gpu-sharing) - [Challenges and Solutions for Efficient, Large-Scale Video Analysis](https://www.wearedevelopers.com/videos/2022-challenges-and-solutions-for-efficient-large-scale-video-analysis) ## Related Articles - [What Are Large Language Models?](https://www.wearedevelopers.com/magazine/304-what-are-large-language-models) - [Dev Digest 121 - AI goes offline](https://www.wearedevelopers.com/magazine/456-dev-digest-121-ai-goes-offline) - [How to Become an AI Engineer](https://www.wearedevelopers.com/magazine/331-how-to-become-an-ai-engineer) - [From Prototype to Production: Build AI Agents with This Free 4-Course Learning Path](https://www.wearedevelopers.com/magazine/655-from-prototype-to-production-build-ai-agents-with-this-free-4-course-learning-path) - [Got AI ideas but no money? Here are 10 free ways to level up your AI skills with Google Cloud](https://www.wearedevelopers.com/magazine/600-got-ai-ideas-but-no-money-here-are-10-free-ways-to-level-up-your-ai-skills-with-google-cloud) - [MLOps And AI Driven Development](https://www.wearedevelopers.com/magazine/82-mlops-and-ai-driven-development)