Principal LLM Inference Engineer - F/H
- Discuss this with your agent
- Open in Claude
- Open in ChatGPT
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Role details
Tech stack
+3 more
Job description
Bull recherche un(e) Staff / Principal LLM Inference Engineer au sein de lâĂ©quipe produit BSQAI pour piloter la pile dâinfĂ©rence de BullSequana AI (BSQAI) et son intĂ©gration avec la plateforme matĂ©rielle BullSequana. La pile fournit un serving de LLM natif Kubernetes (modĂšles multi-nĆuds open-weight, embedding, reranking et multimodaux), standardisĂ© sur llm-d pour lâinfĂ©rence distribuĂ©e et dĂ©sagrĂ©gĂ©e, dĂ©ployĂ© sur des infrastructures dâIA souveraines sur site, sur le cloud souverain ou en hybride.
Ce poste Ă portĂ©e âstaff-to-principalâ combine une influence architecturale transversale et une direction technique concrĂšte dĂ©livrĂ©e par de lâingĂ©nierie hands-on, en Ă©troite collaboration avec les Ă©quipes Data, Services IA, Agents, Foundation, ainsi que le matĂ©riel, lâavant-vente et le delivery. Lâimpact attendu est direct : rĂ©duction mesurable du coĂ»t par token et de la latence de queue, et industrialisation de dĂ©ploiements fiables et sĂ©curisĂ©s (environnements connectĂ©s et isolĂ©s/air-gapped).
Responsabilités principales
- Serving et Runtime des modĂšles : Concevoir et optimiser la plateforme de serving basĂ©e sur vLLM, configurer le parallĂ©lisme selon lâarchitecture du modĂšle et lâinterconnexion de lâinfrastructure cible, et installer/maintenir llm-d pour lâinfĂ©rence distribuĂ©e et dĂ©sagrĂ©gĂ©e (prĂ©remplissage/dĂ©codage dĂ©sagrĂ©gĂ©s, routage conscient du cache KV).
- Cycle de vie et pipelines multimodaux : MaĂźtriser le cycle de vie des modĂšles en plateforme (versioning, dĂ©ploiement progressif, rollback) y compris en environnements isolĂ©s, et servir des pipelines multimodaux (audio temps rĂ©el, STT, TTS, OCR) ainsi que des services dâembedding et de reranking (bases vectorielles comme Milvus).
- FiabilitĂ©, ObservabilitĂ© et Benchmarking : Instrumenter la couche de serving avec Prometheus et Grafana (mĂ©triques GPU et par token, logs structurĂ©s, traçabilitĂ©), mettre en place des dĂ©ploiements canary/blue-green avec portes dâĂ©valuation automatisĂ©es, et mener des campagnes de benchmarking structurĂ©es pour suivre et rĂ©duire le coĂ»t par token et la latence de queue.
- Support Avant-Vente et Dimensionnement : Fournir des donnĂ©es de dimensionnement et de performance dĂ©fendables pour appuyer les activitĂ©s dâavant-vente, les appels dâoffres et la planification de capacitĂ©., * Occuper un rĂŽle central dans la construction de lâinfrastructure dâIA souveraine europĂ©enne, dĂ©ployĂ©e pour des clients des secteurs public et privĂ© Ă travers lâEurope.
- BĂ©nĂ©ficier dâun accĂšs hands-on Ă une infrastructure GPU de grande Ă©chelle et de pointe (plateformes NVIDIA et AMD, BullSequana) pour le benchmarking et lâoptimisation Ă Ă©chelle rĂ©elle.
- Disposer dâune influence de niveau architecte sur la conception, la spĂ©cification et la commercialisation de la plateforme BullSequana AI, tout en conservant lâautonomie nĂ©cessaire pour coder et dĂ©livrer concrĂštement., Vous ne devriez pas postuler si vous recherchez un poste de dĂ©veloppement applicatif gĂ©nĂ©raliste ou de recherche pure, car ce rĂŽle exige une maĂźtrise technique pointue et quotidienne des contraintes bas-niveau de lâinfrastructure dâinfĂ©rence, de la topologie matĂ©rielle (GPU, interconnexions) et du fine-tuning de la performance Ă grande Ă©chelle.
Processus de recrutement
- Entretiens avec le Talent Acquisition Business Partner (TABP)
- Entretien avec un de nos opérationnels
- Entrerien avec notre Head of BL
- Entretien final avec notre HRBP
Requirements
- ExpĂ©rience : Solide parcours (gĂ©nĂ©ralement 7+ ans dâexpĂ©rience en ingĂ©nierie avec un temps significatif dĂ©diĂ© au serving de modĂšles ML/AI) dans la construction et lâexploitation dâinfĂ©rences LLM en production.
- CompĂ©tences techniques clĂ©s : ExpĂ©rience pratique dĂ©montrĂ©e des plateformes de serving de modĂšles natives Kubernetes et de lâinfĂ©rence distribuĂ©e (idĂ©alement llm-d ou une pile Ă©quivalente comme Dynamo).
- Architecture des modÚles : Compréhension fine des architectures de modÚles open-weight courantes (Mistral, Llama, Qwen, Kimi, DeepSeek, GPT-OSS, Gemma) et de leur impact sur les performances de serving (MoE, MTP, Sparse Attention, MLA).
- Soft skills : CapacitĂ© avĂ©rĂ©e Ă communiquer des idĂ©es complexes en anglais, Ă lâĂ©crit comme Ă lâoral, face Ă des interlocuteurs techniques et commerciaux.
Compétences techniques et outils principaux :
- Langages et développement : Python avancé (profiling, async, FastAPI) et Go.
- Moteurs et piles dâinfĂ©rence : vLLM, llm-d, SGLang, TensorRT-LLM, NVIDIA Dynamo, et gestion des architectures distribuĂ©es/dĂ©sagrĂ©gĂ©es (prĂ©remplissage/dĂ©codage sĂ©parĂ©s, routage KV-cache).
- Plateforme et conteneurisation : Kubernetes, Docker, Helm, KServe, opérateurs GPU.
- Matériel et infrastructures : Clusters GPU NVIDIA et AMD, NVLink, interconnexions haute vitesse (InfiniBand / RoCE), systÚmes type NVL72.
- Optimisation de modĂšles : Techniques de quantification (FP8, NVFP4, AWQ, GPTQ), formats (Safetensors) et maĂźtrise des architectures de modĂšles (MoE, MTP, Sparse Attention, MLA).
- Observabilité et Benchmarking : Prometheus, Grafana, outils de tracing distribué, et suites de benchmarks (MLPerf Inference, GenAI-Perf, vLLM benchmarks)., Ici, vos idées, votre curiosité et votre excellence technique contribuent directement à façonner la prochaine Úre du calcul avancé - en créant de la valeur pour les entreprises, en accélérant le progrÚs scientifique et en générant un impact positif pour la société.
Benefits & conditions
Localisation : Postes rattachés aux implantations Bull / BSQAI - priorité Sophia Antipolis - La Défense.
Rémunération : En ligne avec les standards du profil Staff / Principal.
Date de démarrage : DÚs que possible.
About the company
A propos de Bull
Bull câest une histoire. Un siĂšcle dâinnovation EuropĂ©enne et un environnement de travail oĂč des experts conçoivent des solutions numĂ©riques puissantes, durables et souveraines, permettant aux Ătats et aux industries de garder la pleine maĂźtrise de leurs donnĂ©es et de leur IA.
Bull câest aussi des milliers dâingĂ©nieurs, de chercheurs, de passionnĂ©s de tech, façonnant lâavenir du calcul de haute performance, de lâIA et des technologies quantiques.
Chaque jour, nos Ă©quipes repoussent les limites du possible - des architectures HPC de nouvelle gĂ©nĂ©ration aux supercalculateurs exascale - soutenues par une R&D de rang mondial, plus de 1 600 brevets et des capacitĂ©s de bout en bout uniques, couvrant la conception matĂ©rielle, lâingĂ©nierie logicielle, la data science et la recherche quantique.
CentrĂ©s sur lâhumain et portĂ©s par lâinnovation, oĂč la collaboration sâĂ©tend Ă lâEurope, aux AmĂ©riques et Ă lâInde, nous partageons cette mĂȘme vision dâune innovation responsable et durable, avec un impact concret pour nos clients.
Apply for this position
This job is hosted externally. Click below to view the full posting and apply.
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Good distractions
Talks and stories from around this role â technically off-topic, practically not.
Moments
Explore playlistsVideos
See allRelated articles
See all
MLops â Deploying, Maintaining And Evolving Machine Learning Models in Production
MLOps And AI Driven Development
MLOps â Whatâs the deal behind it?
How to Become an AI Engineer