Principal LLM Inference Engineer - F/H

EVIDEN FRANCE
Bezons, France
29 days ago
Apply on fr.indeed.com
Prepare application

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours
Languages
English
Job source

Tech stack

Artificial Intelligence Profiling InfiniBand Python (Programming Language) Prometheus Management of Software Versions Large Language Models Grafana Generative AI Fastapi Perf (Linux) Kubernetes
+4 more
TensorRT Decoding GPT Docker

Job description

Bull recherche un(e) Staff / Principal LLM Inference Engineer au sein de l’équipe produit BSQAI pour piloter la pile d’infĂ©rence de BullSequana AI (BSQAI) et son intĂ©gration avec la plateforme matĂ©rielle BullSequana. La pile fournit un serving de LLM natif Kubernetes (modĂšles multi-nƓuds open-weight, embedding, reranking et multimodaux), standardisĂ© sur llm-d pour l’infĂ©rence distribuĂ©e et dĂ©sagrĂ©gĂ©e, dĂ©ployĂ© sur des infrastructures d’IA souveraines sur site, sur le cloud souverain ou en hybride.

Ce poste Ă  portĂ©e “staff-to-principal” combine une influence architecturale transversale et une direction technique concrĂšte dĂ©livrĂ©e par de l’ingĂ©nierie hands-on, en Ă©troite collaboration avec les Ă©quipes Data, Services IA, Agents, Foundation, ainsi que le matĂ©riel, l’avant-vente et le delivery. L’impact attendu est direct : rĂ©duction mesurable du coĂ»t par token et de la latence de queue, et industrialisation de dĂ©ploiements fiables et sĂ©curisĂ©s (environnements connectĂ©s et isolĂ©s/air-gapped).

Responsabilités principales

Serving et Runtime des modĂšles : Concevoir et optimiser la plateforme de serving basĂ©e sur vLLM, configurer le parallĂ©lisme selon l’architecture du modĂšle et l’interconnexion de l’infrastructure cible, et installer/maintenir llm-d pour l’infĂ©rence distribuĂ©e et dĂ©sagrĂ©gĂ©e (prĂ©remplissage/dĂ©codage dĂ©sagrĂ©gĂ©s, routage conscient du cache KV).

Cycle de vie et pipelines multimodaux : MaĂźtriser le cycle de vie des modĂšles en plateforme (versioning, dĂ©ploiement progressif, rollback) y compris en environnements isolĂ©s, et servir des pipelines multimodaux (audio temps rĂ©el, STT, TTS, OCR) ainsi que des services d’embedding et de reranking (bases vectorielles comme Milvus).

FiabilitĂ©, ObservabilitĂ© et Benchmarking : Instrumenter la couche de serving avec Prometheus et Grafana (mĂ©triques GPU et par token, logs structurĂ©s, traçabilitĂ©), mettre en place des dĂ©ploiements canary/blue-green avec portes d’évaluation automatisĂ©es, et mener des campagnes de benchmarking structurĂ©es pour suivre et rĂ©duire le coĂ»t par token et la latence de queue.

Support Avant-Vente et Dimensionnement : Fournir des donnĂ©es de dimensionnement et de performance dĂ©fendables pour appuyer les activitĂ©s d’avant-vente, les appels d’offres et la planification de capacitĂ©., Moteurs et piles d’infĂ©rence : vLLM, llm-d, SGLang, TensorRT-LLM, NVIDIA Dynamo, et gestion des architectures distribuĂ©es/dĂ©sagrĂ©gĂ©es (prĂ©remplissage/dĂ©codage sĂ©parĂ©s, routage KV-cache).

Plateforme et conteneurisation : Kubernetes, Docker, Helm, KServe, opérateurs GPU.

Matériel et infrastructures : Clusters GPU NVIDIA et AMD, NVLink, interconnexions haute vitesse (InfiniBand / RoCE), systÚmes type NVL72.

Optimisation de modĂšles : Techniques de quantification (FP8, NVFP4, AWQ, GPTQ), formats (Safetensors) et maĂźtrise des architectures de modĂšles (MoE, MTP, Sparse Attention, MLA).

Observabilité et Benchmarking : Prometheus, Grafana, outils de tracing distribué, et suites de benchmarks (MLPerf Inference, GenAI-Perf, vLLM benchmarks).

Pourquoi postuler

Occuper un rĂŽle central dans la construction de l’infrastructure d’IA souveraine europĂ©enne, dĂ©ployĂ©e pour des clients des secteurs public et privĂ© Ă  travers l’Europe.

BĂ©nĂ©ficier d’un accĂšs hands-on Ă  une infrastructure GPU de grande Ă©chelle et de pointe (plateformes NVIDIA et AMD, BullSequana) pour le benchmarking et l’optimisation Ă  Ă©chelle rĂ©elle.

Disposer d’une influence de niveau architecte sur la conception, la spĂ©cification et la commercialisation de la plateforme BullSequana AI, tout en conservant l’autonomie nĂ©cessaire pour coder et dĂ©livrer concrĂštement., Vous ne devriez pas postuler si vous recherchez un poste de dĂ©veloppement applicatif gĂ©nĂ©raliste ou de recherche pure, car ce rĂŽle exige une maĂźtrise technique pointue et quotidienne des contraintes bas-niveau de l’infrastructure d’infĂ©rence, de la topologie matĂ©rielle (GPU, interconnexions) et du fine-tuning de la performance Ă  grande Ă©chelle.

Processus de recrutement

Entretiens avec le Talent Acquisition Business Partner (TABP)

Entretien avec un de nos opérationnels

Entrerien avec notre Head of BL

Entretien final avec notre HRBP

Requirements

ExpĂ©rience : Solide parcours (gĂ©nĂ©ralement 7+ ans d’expĂ©rience en ingĂ©nierie avec un temps significatif dĂ©diĂ© au serving de modĂšles ML/AI) dans la construction et l’exploitation d’infĂ©rences LLM en production.

CompĂ©tences techniques clĂ©s : ExpĂ©rience pratique dĂ©montrĂ©e des plateformes de serving de modĂšles natives Kubernetes et de l’infĂ©rence distribuĂ©e (idĂ©alement llm-d ou une pile Ă©quivalente comme Dynamo).

Architecture des modÚles : Compréhension fine des architectures de modÚles open-weight courantes (Mistral, Llama, Qwen, Kimi, DeepSeek, GPT-OSS, Gemma) et de leur impact sur les performances de serving (MoE, MTP, Sparse Attention, MLA).

Soft skills : CapacitĂ© avĂ©rĂ©e Ă  communiquer des idĂ©es complexes en anglais, Ă  l’écrit comme Ă  l’oral, face Ă  des interlocuteurs techniques et commerciaux.

Compétences techniques et outils principaux : Langages et développement : Python avancé (profiling, async, FastAPI) et Go., Ici, vos idées, votre curiosité et votre excellence technique contribuent directement à façonner la prochaine Úre du calcul avancé - en créant de la valeur pour les entreprises, en accélérant le progrÚs scientifique et en générant un impact positif pour la société.

Benefits & conditions

Localisation : Postes rattachés aux implantations Bull / BSQAI - priorité Sophia Antipolis - La Défense.

Rémunération : En ligne avec les standards du profil Staff / Principal.

Date de démarrage : DÚs que possible.

About the company

Bull c’est une histoire. Un siĂšcle d’innovation EuropĂ©enne et un environnement de travail oĂč des experts conçoivent des solutions numĂ©riques puissantes, durables et souveraines, permettant aux États et aux industries de garder la pleine maĂźtrise de leurs donnĂ©es et de leur IA.

Bull c’est aussi des milliers d’ingĂ©nieurs, de chercheurs, de passionnĂ©s de tech, façonnant l’avenir du calcul de haute performance, de l’IA et des technologies quantiques.

Chaque jour, nos Ă©quipes repoussent les limites du possible - des architectures HPC de nouvelle gĂ©nĂ©ration aux supercalculateurs exascale - soutenues par une R&D de rang mondial, plus de 1 600 brevets et des capacitĂ©s de bout en bout uniques, couvrant la conception matĂ©rielle, l’ingĂ©nierie logicielle, la data science et la recherche quantique.

CentrĂ©s sur l’humain et portĂ©s par l’innovation, oĂč la collaboration s’étend Ă  l’Europe, aux AmĂ©riques et Ă  l’Inde, nous partageons cette mĂȘme vision d’une innovation responsable et durable, avec un impact concret pour nos clients.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on fr.indeed.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

2:37 min

Optimizing technical profiles for AI sourcing and recruitment

Mina Golesorkhi Mina Golesorkhi · World Congress 2026 Europe

40 sec

Generative pre-trained transformer models powering code completions

lgonta lgonta +1 · World Congress 2024

2:07 min

Inspecting default bridge architectures and custom Docker networks

Oliver Seitz Oliver Seitz · World Congress 2025

1:07 min

Architecting the availability stack with Prometheus and Grafana

Gabriel Labachelerie · World Congress 2023

3:14 min

Structuring career paths and localized data architectures

Ulrich Wurstbauer +1 · LIVE

51 sec

Assessing GPT-4o performance for pull request feedback

Merrill Lutsky Merrill Lutsky · World Congress 2025

Videos

See all

Related articles

See all