Principal Llm Inference Engineer H/F

Bullsequana
Sophia Antipolis, France
17 days ago
Apply on www.hellowork.com
Prepare application

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours
Languages
English

Tech stack

Artificial Intelligence InfiniBand Python (Programming Language) Prometheus Management of Software Versions Large Language Models Grafana Generative AI Fastapi Perf (Linux) Kubernetes TensorRT
+3 more
Decoding GPT Docker

Job description

Serving et Runtime des modĂšles : Concevoir et optimiser la plateforme de serving basĂ©e sur vLLM, configurer le parallĂ©lisme selon l’architecture du modĂšle et l’interconnexion de l’infrastructure cible, et installer/maintenir llm-d pour l’infĂ©rence distribuĂ©e et dĂ©sagrĂ©gĂ©e (prĂ©remplissage/dĂ©codage dĂ©sagrĂ©gĂ©s, routage conscient du cache KV). * Cycle de vie et pipelines multimodaux : MaĂźtriser le cycle de vie des modĂšles en plateforme (versioning, dĂ©ploiement progressif, rollback) y compris en environnements isolĂ©s, et servir des pipelines multimodaux (audio temps rĂ©el, STT, TTS, OCR) ainsi que des services d’embedding et de reranking (bases vectorielles comme Milvus). * FiabilitĂ©, ObservabilitĂ© et Benchmarking : Instrumenter la couche de serving avec Prometheus et Grafana (mĂ©triques GPU et par token, logs structurĂ©s, traçabilitĂ©), mettre en place des dĂ©ploiements canary/blue-green avec portes d’évaluation automatisĂ©es, et mener des campagnes de benchmarking structurĂ©es pour suivre et rĂ©duire le coĂ»t par token et la latence de queue. * Support Avant-Vente et Dimensionnement : Fournir des donnĂ©es de dimensionnement et de performance dĂ©fendables pour appuyer les activitĂ©s d’avant-vente, les appels d’offres et la planification de capacitĂ©., Bull recherche un(e) Staff / Principal LLM Inference Engineer au sein de l’équipe produit BSQAI pour piloter la pile d’infĂ©rence de BullSequana AI (BSQAI) et son intĂ©gration avec la plateforme matĂ©rielle BullSequana. La pile fournit un serving de LLM natif Kubernetes (modĂšles multi-noeuds open-weight, embedding, reranking et multimodaux), standardisĂ© sur llm-d pour l’infĂ©rence distribuĂ©e et dĂ©sagrĂ©gĂ©e, dĂ©ployĂ© sur des infrastructures d’IA souveraines sur site, sur le cloud souverain ou en hybride.

Ce poste Ă  portĂ©e “staff-to-principal” combine une influence architecturale transversale et une direction technique concrĂšte dĂ©livrĂ©e par de l’ingĂ©nierie hands-on, en Ă©troite collaboration avec les Ă©quipes Data, Services IA, Agents, Foundation, ainsi que le matĂ©riel, l’avant-vente et le delivery. L’impact attendu est direct : rĂ©duction mesurable du coĂ»t par token et de la latence de queue, et industrialisation de dĂ©ploiements fiables et sĂ©curisĂ©s (environnements connectĂ©s et isolĂ©s/air-gapped).

Requirements

CompĂ©tences et qualifications * ExpĂ©rience : Solide parcours (gĂ©nĂ©ralement 7+ ans d’expĂ©rience en ingĂ©nierie avec un temps significatif dĂ©diĂ© au serving de modĂšles ML/AI) dans la construction et l’exploitation d’infĂ©rences LLM en production.* CompĂ©tences techniques clĂ©s : ExpĂ©rience pratique dĂ©montrĂ©e des plateformes de serving de modĂšles natives Kubernetes et de l’infĂ©rence distribuĂ©e (idĂ©alement llm-d ou une pile Ă©quivalente comme Dynamo).* Architecture des modĂšles : ComprĂ©hension fine des architectures de modĂšles open-weight courantes (Mistral, Llama, Qwen, Kimi, DeepSeek, GPT-OSS, Gemma) et de leur impact sur les performances de serving (MoE, MTP, Sparse Attention, MLA).* Soft skills : CapacitĂ© avĂ©rĂ©e Ă  communiquer des idĂ©es complexes en anglais, Ă  l’écrit comme Ă  l’oral, face Ă  des interlocuteurs techniques et commerciaux. CompĂ©tences techniques et outils principaux : * Langages et dĂ©veloppement : Python avancĂ© (profiling, async, FastAPI) et Go.* Moteurs et piles d’infĂ©rence : vLLM, llm-d, SGLang, TensorRT-LLM, NVIDIA Dynamo, et gestion des architectures distribuĂ©es/dĂ©sagrĂ©gĂ©es (prĂ©remplissage/dĂ©codage sĂ©parĂ©s, routage KV-cache).* Plateforme et conteneurisation : Kubernetes, Docker, Helm, KServe, opĂ©rateurs GPU.* MatĂ©riel et infrastructures : Clusters GPU NVIDIA et AMD, NVLink, interconnexions haute vitesse (InfiniBand / RoCE), systĂšmes type NVL72.* Optimisation de modĂšles : Techniques de quantification (FP8, NVFP4, AWQ, GPTQ), formats (Safetensors) et maĂźtrise des architectures de modĂšles (MoE, MTP, Sparse Attention, MLA).* ObservabilitĂ© et Benchmarking : Prometheus, Grafana, outils de tracing distribuĂ©, et suites de benchmarks (MLPerf Inference, GenAI-Perf, vLLM benchmarks)., ExpĂ©rience : Solide parcours (gĂ©nĂ©ralement 7+ ans d’expĂ©rience en ingĂ©nierie avec un temps significatif dĂ©diĂ© au serving de modĂšles ML/AI) dans la construction et l’exploitation d’infĂ©rences LLM en production. * CompĂ©tences techniques clĂ©s : ExpĂ©rience pratique dĂ©montrĂ©e des plateformes de serving de modĂšles natives Kubernetes et de l’infĂ©rence distribuĂ©e (idĂ©alement llm-d ou une pile Ă©quivalente comme Dynamo). * Architecture des modĂšles : ComprĂ©hension fine des architectures de modĂšles open-weight courantes (Mistral, Llama, Qwen, Kimi, DeepSeek, GPT-OSS, Gemma) et de leur impact sur les performances de serving (MoE, MTP, Sparse Attention, MLA). * Soft skills : CapacitĂ© avĂ©rĂ©e Ă  communiquer des idĂ©es complexes en anglais, Ă  l’écrit comme Ă  l’oral, face Ă  des interlocuteurs techniques et commerciaux.

Compétences techniques et outils principaux :

* Langages et dĂ©veloppement : Python avancĂ© (profiling, async, FastAPI) et Go. * Moteurs et piles d’infĂ©rence : vLLM, llm-d, SGLang, TensorRT-LLM, NVIDIA Dynamo, et gestion des architectures distribuĂ©es/dĂ©sagrĂ©gĂ©es (prĂ©remplissage/dĂ©codage sĂ©parĂ©s, routage KV-cache). * Plateforme et conteneurisation : Kubernetes, Docker, Helm, KServe, opĂ©rateurs GPU. * MatĂ©riel et infrastructures : Clusters GPU NVIDIA et AMD, NVLink, interconnexions haute vitesse (InfiniBand / RoCE), systĂšmes type NVL72. * Optimisation de modĂšles : Techniques de quantification (FP8, NVFP4, AWQ, GPTQ), formats (Safetensors) et maĂźtrise des architectures de modĂšles (MoE, MTP, Sparse Attention, MLA). * ObservabilitĂ© et Benchmarking : Prometheus, Grafana, outils de tracing distribuĂ©, et suites de benchmarks (MLPerf Inference, GenAI-Perf, vLLM benchmarks)., Intelligence artificielle Kubernetes Python Docker

About the company

Bull c’est une histoire. Un siĂšcle d’innovation EuropĂ©enne et un environnement de travail oĂč des experts conçoivent des solutions numĂ©riques puissantes, durables et souveraines, permettant aux États et aux industries de garder la pleine maĂźtrise de leurs donnĂ©es et de leur IA. Bull c’est aussi des milliers d’ingĂ©nieurs, de chercheurs, de passionnĂ©s de tech, façonnant l’avenir du calcul de haute performance, de l’IA et des technologies quantiques. Chaque jour, nos Ă©quipes repoussent les limites du possible - des architectures HPC de nouvelle gĂ©nĂ©ration aux supercalculateurs exascale - soutenues par une R&D de rang mondial, plus de 1 600 brevets et des capacitĂ©s de bout en bout uniques, couvrant la conception matĂ©rielle, l’ingĂ©nierie logicielle, la data science et la recherche quantique. CentrĂ©s sur l’humain et portĂ©s par l’innovation, oĂč la collaboration s’étend Ă  l’Europe, aux AmĂ©riques et Ă  l’Inde, nous partageons cette mĂȘme vision d’une innovation responsable et durable, avec un impact concret pour nos clients., A propos de BullBull c’est une histoire. Un siĂšcle d’innovation EuropĂ©enne et un environnement de travail oĂč des experts conçoivent des solutions numĂ©riques puissantes, durables et souveraines, permettant aux États et aux industries de garder la pleine maĂźtrise de leurs donnĂ©es et de leur IA.Bull c’est aussi des milliers d’ingĂ©nieurs, de chercheurs, de passionnĂ©s de tech, façonnant l’avenir du calcul de haute performance, de l’IA et des technologies quantiques.Chaque jour, nos Ă©quipes repoussent les limites du possible - des architectures HPC de nouvelle gĂ©nĂ©ration aux supercalculateurs exascale - soutenues par une R&D de rang mondial, plus de 1 600 brevets et des capacitĂ©s de bout en bout uniques, couvrant la conception matĂ©rielle, l’ingĂ©nierie logicielle, la data science et la recherche quantique.CentrĂ©s sur l’humain et portĂ©s par l’innovation, oĂč la collaboration s’étend Ă  l’Europe, aux AmĂ©riques et Ă  l’Inde, nous partageons cette mĂȘme vision d’une innovation responsable et durable, avec un impact concret pour nos clients.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.hellowork.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

4:57 min

Centralizing LLMOps workflows within Azure AI Foundry

Maxim Salnikov Maxim Salnikov · LIVE

40 sec

Generative pre-trained transformer models powering code completions

lgonta lgonta +1 · World Congress 2024

2:07 min

Inspecting default bridge architectures and custom Docker networks

Oliver Seitz Oliver Seitz · World Congress 2025

10:40 min

Visualizing Prometheus open metrics using custom Grafana dashboards

Stijn Polfliet · LIVE

2:13 min

Enhancing personal developer productivity with AI tools

Eric Bowman Eric Bowman · World Congress 2026 Europe

51 sec

Assessing GPT-4o performance for pull request feedback

Merrill Lutsky Merrill Lutsky · World Congress 2025

Videos

See all

Related articles

See all