> Markdown version of [/jobs/ext/2701827-principal-llm-inference-engineer-h-f](https://www.wearedevelopers.com/jobs/ext/2701827-principal-llm-inference-engineer-h-f). Every page supports `.md` or `Accept: text/markdown`. Links point to the HTML versions so they work for humans too. Agent guide: [/agents.md](https://www.wearedevelopers.com/agents.md). --- # Principal Llm Inference Engineer H/F - **Company:** Bullsequana - **Location:** Sophia Antipolis, France - **Contract:** Permanent contract - **Skills:** Artificial Intelligence, InfiniBand, Python (Programming Language), Prometheus, Management of Software Versions, Large Language Models, Grafana, Generative AI, Fastapi, Perf (Linux), Kubernetes, TensorRT, Decoding, GPT, Docker - **Published:** September 4, 2026 - **Apply:** https://www.hellowork.com/fr-fr/emplois/82993650.html ## About the Role Compétences et qualifications * Expérience : Solide parcours (généralement 7+ ans d'expérience en ingénierie avec un temps significatif dédié au serving de modèles ML/AI) dans la construction et l'exploitation d'inférences LLM en production.* Compétences techniques clés : Expérience pratique démontrée des plateformes de serving de modèles natives Kubernetes et de l'inférence distribuée (idéalement llm-d ou une pile équivalente comme Dynamo).* Architecture des modèles : Compréhension fine des architectures de modèles open-weight courantes (Mistral, Llama, Qwen, Kimi, DeepSeek, GPT-OSS, Gemma) et de leur impact sur les performances de serving (MoE, MTP, Sparse Attention, MLA).* Soft skills : Capacité avérée à communiquer des idées complexes en anglais, à l'écrit comme à l'oral, face à des interlocuteurs techniques et commerciaux. Compétences techniques et outils principaux : * Langages et développement : Python avancé (profiling, async, FastAPI) et Go.* Moteurs et piles d'inférence : vLLM, llm-d, SGLang, TensorRT-LLM, NVIDIA Dynamo, et gestion des architectures distribuées/désagrégées (préremplissage/décodage séparés, routage KV-cache).* Plateforme et conteneurisation : Kubernetes, Docker, Helm, KServe, opérateurs GPU.* Matériel et infrastructures : Clusters GPU NVIDIA et AMD, NVLink, interconnexions haute vitesse (InfiniBand / RoCE), systèmes type NVL72.* Optimisation de modèles : Techniques de quantification (FP8, NVFP4, AWQ, GPTQ), formats (Safetensors) et maîtrise des architectures de modèles (MoE, MTP, Sparse Attention, MLA).* Observabilité et Benchmarking : Prometheus, Grafana, outils de tracing distribué, et suites de benchmarks (MLPerf Inference, GenAI-Perf, vLLM benchmarks)., Expérience : Solide parcours (généralement 7+ ans d'expérience en ingénierie avec un temps significatif dédié au serving de modèles ML/AI) dans la construction et l'exploitation d'inférences LLM en production. * Compétences techniques clés : Expérience pratique démontrée des plateformes de serving de modèles natives Kubernetes et de l'inférence distribuée (idéalement llm-d ou une pile équivalente comme Dynamo). * Architecture des modèles : Compréhension fine des architectures de modèles open-weight courantes (Mistral, Llama, Qwen, Kimi, DeepSeek, GPT-OSS, Gemma) et de leur impact sur les performances de serving (MoE, MTP, Sparse Attention, MLA). * Soft skills : Capacité avérée à communiquer des idées complexes en anglais, à l'écrit comme à l'oral, face à des interlocuteurs techniques et commerciaux. Compétences techniques et outils principaux : * Langages et développement : Python avancé (profiling, async, FastAPI) et Go. * Moteurs et piles d'inférence : vLLM, llm-d, SGLang, TensorRT-LLM, NVIDIA Dynamo, et gestion des architectures distribuées/désagrégées (préremplissage/décodage séparés, routage KV-cache). * Plateforme et conteneurisation : Kubernetes, Docker, Helm, KServe, opérateurs GPU. * Matériel et infrastructures : Clusters GPU NVIDIA et AMD, NVLink, interconnexions haute vitesse (InfiniBand / RoCE), systèmes type NVL72. * Optimisation de modèles : Techniques de quantification (FP8, NVFP4, AWQ, GPTQ), formats (Safetensors) et maîtrise des architectures de modèles (MoE, MTP, Sparse Attention, MLA). * Observabilité et Benchmarking : Prometheus, Grafana, outils de tracing distribué, et suites de benchmarks (MLPerf Inference, GenAI-Perf, vLLM benchmarks)., Intelligence artificielle Kubernetes Python Docker ## Description Serving et Runtime des modèles : Concevoir et optimiser la plateforme de serving basée sur vLLM, configurer le parallélisme selon l'architecture du modèle et l'interconnexion de l'infrastructure cible, et installer/maintenir llm-d pour l'inférence distribuée et désagrégée (préremplissage/décodage désagrégés, routage conscient du cache KV). * Cycle de vie et pipelines multimodaux : Maîtriser le cycle de vie des modèles en plateforme (versioning, déploiement progressif, rollback) y compris en environnements isolés, et servir des pipelines multimodaux (audio temps réel, STT, TTS, OCR) ainsi que des services d'embedding et de reranking (bases vectorielles comme Milvus). * Fiabilité, Observabilité et Benchmarking : Instrumenter la couche de serving avec Prometheus et Grafana (métriques GPU et par token, logs structurés, traçabilité), mettre en place des déploiements canary/blue-green avec portes d'évaluation automatisées, et mener des campagnes de benchmarking structurées pour suivre et réduire le coût par token et la latence de queue. * Support Avant-Vente et Dimensionnement : Fournir des données de dimensionnement et de performance défendables pour appuyer les activités d'avant-vente, les appels d'offres et la planification de capacité., Bull recherche un(e) Staff / Principal LLM Inference Engineer au sein de l'équipe produit BSQAI pour piloter la pile d'inférence de BullSequana AI (BSQAI) et son intégration avec la plateforme matérielle BullSequana. La pile fournit un serving de LLM natif Kubernetes (modèles multi-noeuds open-weight, embedding, reranking et multimodaux), standardisé sur llm-d pour l'inférence distribuée et désagrégée, déployé sur des infrastructures d'IA souveraines sur site, sur le cloud souverain ou en hybride. Ce poste à portée "staff-to-principal" combine une influence architecturale transversale et une direction technique concrète délivrée par de l'ingénierie hands-on, en étroite collaboration avec les équipes Data, Services IA, Agents, Foundation, ainsi que le matériel, l'avant-vente et le delivery. L'impact attendu est direct : réduction mesurable du coût par token et de la latence de queue, et industrialisation de déploiements fiables et sécurisés (environnements connectés et isolés/air-gapped). ## Related Videos - [ Evaluating AI models for code comprehension](https://www.wearedevelopers.com/videos/1462-evaluating-ai-models-for-code-comprehension) - [Docker Compose: Rediscovered](https://www.wearedevelopers.com/videos/1978-docker-compose-rediscovered) - [5 steps for running a Kubernetes environment at scale](https://www.wearedevelopers.com/videos/88-5-steps-for-running-a-kubernetes-environment-at-scale) - [Efficient deployment and inference of GPU-accelerated LLMs​](https://www.wearedevelopers.com/videos/929-efficient-deployment-and-inference-of-gpu-accelerated-llms) - [DevOps for AI: running LLMs in production with Kubernetes and KubeFlow](https://www.wearedevelopers.com/videos/1222-devops-for-ai-running-llms-in-production-with-kubernetes-and-kubeflow) - [Speak, Code, Deploy: Transforming Developer Experience with Voice Commands](https://www.wearedevelopers.com/videos/1159-speak-code-deploy-transforming-developer-experience-with-voice-commands) ## Related Articles - [What Are Large Language Models?](https://www.wearedevelopers.com/magazine/304-what-are-large-language-models) - [The Best Large Language Models on The Market](https://www.wearedevelopers.com/magazine/319-the-best-large-language-models-on-the-market) - [MLops – Deploying, Maintaining And Evolving Machine Learning Models in Production](https://www.wearedevelopers.com/magazine/115-mlops-deploying-maintaining-and-evolving-machine-learning-models-in-production) - [MLOps And AI Driven Development](https://www.wearedevelopers.com/magazine/82-mlops-and-ai-driven-development) - [MLOps – What’s the deal behind it?](https://www.wearedevelopers.com/magazine/125-mlops-what-s-the-deal-behind-it) - [Graph and AI Trends 2026: Why Is AI Running but Not Yet Delivering?](https://www.wearedevelopers.com/magazine/680-graph-and-ai-trends-2026-why-is-ai-running-but-not-yet-delivering)