Principal Llm Inference Engineer H/F
- Discuss this with your agent
- Open in Claude
- Open in ChatGPT
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Role details
Tech stack
+3 more
Job description
Serving et Runtime des modĂšles : Concevoir et optimiser la plateforme de serving basĂ©e sur vLLM, configurer le parallĂ©lisme selon lâarchitecture du modĂšle et lâinterconnexion de lâinfrastructure cible, et installer/maintenir llm-d pour lâinfĂ©rence distribuĂ©e et dĂ©sagrĂ©gĂ©e (prĂ©remplissage/dĂ©codage dĂ©sagrĂ©gĂ©s, routage conscient du cache KV). * Cycle de vie et pipelines multimodaux : MaĂźtriser le cycle de vie des modĂšles en plateforme (versioning, dĂ©ploiement progressif, rollback) y compris en environnements isolĂ©s, et servir des pipelines multimodaux (audio temps rĂ©el, STT, TTS, OCR) ainsi que des services dâembedding et de reranking (bases vectorielles comme Milvus). * FiabilitĂ©, ObservabilitĂ© et Benchmarking : Instrumenter la couche de serving avec Prometheus et Grafana (mĂ©triques GPU et par token, logs structurĂ©s, traçabilitĂ©), mettre en place des dĂ©ploiements canary/blue-green avec portes dâĂ©valuation automatisĂ©es, et mener des campagnes de benchmarking structurĂ©es pour suivre et rĂ©duire le coĂ»t par token et la latence de queue. * Support Avant-Vente et Dimensionnement : Fournir des donnĂ©es de dimensionnement et de performance dĂ©fendables pour appuyer les activitĂ©s dâavant-vente, les appels dâoffres et la planification de capacitĂ©., Bull recherche un(e) Staff / Principal LLM Inference Engineer au sein de lâĂ©quipe produit BSQAI pour piloter la pile dâinfĂ©rence de BullSequana AI (BSQAI) et son intĂ©gration avec la plateforme matĂ©rielle BullSequana. La pile fournit un serving de LLM natif Kubernetes (modĂšles multi-noeuds open-weight, embedding, reranking et multimodaux), standardisĂ© sur llm-d pour lâinfĂ©rence distribuĂ©e et dĂ©sagrĂ©gĂ©e, dĂ©ployĂ© sur des infrastructures dâIA souveraines sur site, sur le cloud souverain ou en hybride.
Ce poste Ă portĂ©e âstaff-to-principalâ combine une influence architecturale transversale et une direction technique concrĂšte dĂ©livrĂ©e par de lâingĂ©nierie hands-on, en Ă©troite collaboration avec les Ă©quipes Data, Services IA, Agents, Foundation, ainsi que le matĂ©riel, lâavant-vente et le delivery. Lâimpact attendu est direct : rĂ©duction mesurable du coĂ»t par token et de la latence de queue, et industrialisation de dĂ©ploiements fiables et sĂ©curisĂ©s (environnements connectĂ©s et isolĂ©s/air-gapped).
Requirements
CompĂ©tences et qualifications * ExpĂ©rience : Solide parcours (gĂ©nĂ©ralement 7+ ans dâexpĂ©rience en ingĂ©nierie avec un temps significatif dĂ©diĂ© au serving de modĂšles ML/AI) dans la construction et lâexploitation dâinfĂ©rences LLM en production.* CompĂ©tences techniques clĂ©s : ExpĂ©rience pratique dĂ©montrĂ©e des plateformes de serving de modĂšles natives Kubernetes et de lâinfĂ©rence distribuĂ©e (idĂ©alement llm-d ou une pile Ă©quivalente comme Dynamo).* Architecture des modĂšles : ComprĂ©hension fine des architectures de modĂšles open-weight courantes (Mistral, Llama, Qwen, Kimi, DeepSeek, GPT-OSS, Gemma) et de leur impact sur les performances de serving (MoE, MTP, Sparse Attention, MLA).* Soft skills : CapacitĂ© avĂ©rĂ©e Ă communiquer des idĂ©es complexes en anglais, Ă lâĂ©crit comme Ă lâoral, face Ă des interlocuteurs techniques et commerciaux. CompĂ©tences techniques et outils principaux : * Langages et dĂ©veloppement : Python avancĂ© (profiling, async, FastAPI) et Go.* Moteurs et piles dâinfĂ©rence : vLLM, llm-d, SGLang, TensorRT-LLM, NVIDIA Dynamo, et gestion des architectures distribuĂ©es/dĂ©sagrĂ©gĂ©es (prĂ©remplissage/dĂ©codage sĂ©parĂ©s, routage KV-cache).* Plateforme et conteneurisation : Kubernetes, Docker, Helm, KServe, opĂ©rateurs GPU.* MatĂ©riel et infrastructures : Clusters GPU NVIDIA et AMD, NVLink, interconnexions haute vitesse (InfiniBand / RoCE), systĂšmes type NVL72.* Optimisation de modĂšles : Techniques de quantification (FP8, NVFP4, AWQ, GPTQ), formats (Safetensors) et maĂźtrise des architectures de modĂšles (MoE, MTP, Sparse Attention, MLA).* ObservabilitĂ© et Benchmarking : Prometheus, Grafana, outils de tracing distribuĂ©, et suites de benchmarks (MLPerf Inference, GenAI-Perf, vLLM benchmarks)., ExpĂ©rience : Solide parcours (gĂ©nĂ©ralement 7+ ans dâexpĂ©rience en ingĂ©nierie avec un temps significatif dĂ©diĂ© au serving de modĂšles ML/AI) dans la construction et lâexploitation dâinfĂ©rences LLM en production. * CompĂ©tences techniques clĂ©s : ExpĂ©rience pratique dĂ©montrĂ©e des plateformes de serving de modĂšles natives Kubernetes et de lâinfĂ©rence distribuĂ©e (idĂ©alement llm-d ou une pile Ă©quivalente comme Dynamo). * Architecture des modĂšles : ComprĂ©hension fine des architectures de modĂšles open-weight courantes (Mistral, Llama, Qwen, Kimi, DeepSeek, GPT-OSS, Gemma) et de leur impact sur les performances de serving (MoE, MTP, Sparse Attention, MLA). * Soft skills : CapacitĂ© avĂ©rĂ©e Ă communiquer des idĂ©es complexes en anglais, Ă lâĂ©crit comme Ă lâoral, face Ă des interlocuteurs techniques et commerciaux.
Compétences techniques et outils principaux :
* Langages et dĂ©veloppement : Python avancĂ© (profiling, async, FastAPI) et Go. * Moteurs et piles dâinfĂ©rence : vLLM, llm-d, SGLang, TensorRT-LLM, NVIDIA Dynamo, et gestion des architectures distribuĂ©es/dĂ©sagrĂ©gĂ©es (prĂ©remplissage/dĂ©codage sĂ©parĂ©s, routage KV-cache). * Plateforme et conteneurisation : Kubernetes, Docker, Helm, KServe, opĂ©rateurs GPU. * MatĂ©riel et infrastructures : Clusters GPU NVIDIA et AMD, NVLink, interconnexions haute vitesse (InfiniBand / RoCE), systĂšmes type NVL72. * Optimisation de modĂšles : Techniques de quantification (FP8, NVFP4, AWQ, GPTQ), formats (Safetensors) et maĂźtrise des architectures de modĂšles (MoE, MTP, Sparse Attention, MLA). * ObservabilitĂ© et Benchmarking : Prometheus, Grafana, outils de tracing distribuĂ©, et suites de benchmarks (MLPerf Inference, GenAI-Perf, vLLM benchmarks)., Intelligence artificielle Kubernetes Python Docker
About the company
Bull câest une histoire. Un siĂšcle dâinnovation EuropĂ©enne et un environnement de travail oĂč des experts conçoivent des solutions numĂ©riques puissantes, durables et souveraines, permettant aux Ătats et aux industries de garder la pleine maĂźtrise de leurs donnĂ©es et de leur IA. Bull câest aussi des milliers dâingĂ©nieurs, de chercheurs, de passionnĂ©s de tech, façonnant lâavenir du calcul de haute performance, de lâIA et des technologies quantiques. Chaque jour, nos Ă©quipes repoussent les limites du possible - des architectures HPC de nouvelle gĂ©nĂ©ration aux supercalculateurs exascale - soutenues par une R&D de rang mondial, plus de 1 600 brevets et des capacitĂ©s de bout en bout uniques, couvrant la conception matĂ©rielle, lâingĂ©nierie logicielle, la data science et la recherche quantique. CentrĂ©s sur lâhumain et portĂ©s par lâinnovation, oĂč la collaboration sâĂ©tend Ă lâEurope, aux AmĂ©riques et Ă lâInde, nous partageons cette mĂȘme vision dâune innovation responsable et durable, avec un impact concret pour nos clients., A propos de BullBull câest une histoire. Un siĂšcle dâinnovation EuropĂ©enne et un environnement de travail oĂč des experts conçoivent des solutions numĂ©riques puissantes, durables et souveraines, permettant aux Ătats et aux industries de garder la pleine maĂźtrise de leurs donnĂ©es et de leur IA.Bull câest aussi des milliers dâingĂ©nieurs, de chercheurs, de passionnĂ©s de tech, façonnant lâavenir du calcul de haute performance, de lâIA et des technologies quantiques.Chaque jour, nos Ă©quipes repoussent les limites du possible - des architectures HPC de nouvelle gĂ©nĂ©ration aux supercalculateurs exascale - soutenues par une R&D de rang mondial, plus de 1 600 brevets et des capacitĂ©s de bout en bout uniques, couvrant la conception matĂ©rielle, lâingĂ©nierie logicielle, la data science et la recherche quantique.CentrĂ©s sur lâhumain et portĂ©s par lâinnovation, oĂč la collaboration sâĂ©tend Ă lâEurope, aux AmĂ©riques et Ă lâInde, nous partageons cette mĂȘme vision dâune innovation responsable et durable, avec un impact concret pour nos clients.
Apply for this position
This job is hosted externally. Click below to view the full posting and apply.
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Good distractions
Talks and stories from around this role â technically off-topic, practically not.
Moments
Explore playlistsVideos
See allRelated articles
See all
The Best Large Language Models on The Market
MLops â Deploying, Maintaining And Evolving Machine Learning Models in Production
MLOps And AI Driven Development
MLOps â Whatâs the deal behind it?