> Markdown version of [/jobs/ext/1493358-ingenieur-systeme-hpc-gpu-slurm-f-h](https://www.wearedevelopers.com/jobs/ext/1493358-ingenieur-systeme-hpc-gpu-slurm-f-h). Every page supports `.md` or `Accept: text/markdown`. Links point to the HTML versions so they work for humans too. Agent guide: [/agents.md](https://www.wearedevelopers.com/agents.md). --- # Ingénieur Système HPC / GPU / SLURM F/H - **Company:** Sorbonne Université - **Location:** Paris, France - **Contract:** Temporary contract - **Skills:** Proxmox, Bash Shell, Nvidia CUDA, Debian Linux, Linux, File Systems, Python (Programming Language), Ansible, Tensorflow, Prometheus, Virtual Local Area Networks, Ceph (Software), Pytorch, Grafana, Git, Gitlab-ci, Slurm, Docker, Network Optimization - **Published:** July 30, 2026 - **Apply:** https://www.aplitrak.com/?adid=c3RlbGxhLmFtb3Jpbi4yODQ1MS4xMzE4NEB1bmlwYXJpc3NvcmIuYXBsaXRyYWsuY29t&site=EP&external_jobboard_id_job_offer=4336291 ## About the Role * Solide maîtrise de Linux/Debian : administration système, packaging, systemd, réseau * Expérience confirmée sur SLURM : configuration, partitions, GRES GPU, accounting * Bonne connaissance de l'écosystème NVIDIA : drivers, CUDA, NVML, DCGM * Maîtrise des outils d'automatisation : Ansible, Bash, Python * Expérience sur les réseaux : Bonding, Vlan, routage Compétences appréciées : * Connaissance de systèmes de fichiers distribués : Ceph, cephfs * Pratique de la supervision avec Prometheus, Grafana, Alertmanager * Notions de MPI (OpenMPI, MVAPICH2) et de librairies de calcul (cuBLAS, NCCL) * Expérience avec des frameworks IA/ML : PyTorch, TensorFlow (usage sur HPC) * Connaissances en gestion de version : Git, GitLab CI Qualités personnelles : * Rigueur, méthode et sens de la documentation * Autonomie et capacité à gérer les priorités en environnement de production * Bon relationnel et goût pour le travail en équipe * Curiosité technique et veille active sur l'écosystème HPC/GPU ## Description * Déploiement et maintenance des noeuds de calcul GPU sous Debian * Déploiement et maintenance de noeuds proxmox, vm et docker * Gestion des mises à jour système, des pilotes NVIDIA et des librairies CUDA * Configuration et optimisation du réseau haute performance (bonding, VLAN) * Mise en oeuvre et gestion des systèmes de fichiers distribués (NFS, CEPH, CephFS) * Automatisation des déploiements via Ansible 2. Administration SLURM * Installation, configuration et mise à jour de SLURM (slurmctld, slurmd, slurmdbd) * Définition des partitions, QOS, comptes et limites de ressources * Intégration des GPU NVIDIA dans les ressources SLURM (GRES) * Surveillance des jobs, diagnostics et interventions sur les noeuds en défaut * Rédaction et mise à jour des procédures SLURM à destination des utilisateurs 3. Support utilisateurs et opérateurs * Support de niveau 2/3 pour les utilisateurs de la plateforme HPC * Accompagnement des utilisateurs sur l'optimisation de leurs soumissions SLURM * Participation aux réunions techniques et rédaction des comptes-rendus * Rédaction de la documentation technique et des runbooks 4. Supervision et performance * Mise en place et maintenance des outils de supervision (Prometheus, Grafana) * Analyse des performances GPU (utilisation, mémoire, température, bande passante NVLink) * Optimisation des politiques d'ordonnancement selon la charge de la plateforme * Gestion des incidents et participation aux astreintes selon planning ## Related Videos - [Running Secure Life Science Research at Scale using Hybrid GPU HPC and Kubernetes 🧬](https://www.wearedevelopers.com/videos/100355-running-secure-life-science-research-at-scale-using-hybrid-gpu-hpc-and-kubernetes) - [Accelerating Python on GPUs](https://www.wearedevelopers.com/videos/1521-accelerating-python-on-gpus) - [Docker network without Docker](https://www.wearedevelopers.com/videos/1418-docker-network-without-docker) - [How a Small Team Shrank a Microsoft Monorepo by 94%](https://www.wearedevelopers.com/videos/1236-how-a-small-team-shrank-a-microsoft-monorepo-by-94) - [Docker exec without Docker](https://www.wearedevelopers.com/videos/1094-docker-exec-without-docker) - [Git for Code Reviews](https://www.wearedevelopers.com/videos/429-git-for-code-reviews) ## Related Articles - [How We Built a Worry-Free System That Runs for 10+ Years – And What We’d Do Again](https://www.wearedevelopers.com/magazine/751-how-we-built-a-worry-free-system-that-runs-for-10-years-and-what-we-d-do-again) - [Best Companies to Work For in Paris: Top 25 Companies in 2023 ](https://www.wearedevelopers.com/magazine/190-best-companies-to-work-for-in-paris-top-25-companies-in-2023) - [Top 6 Hackathons for Developers in 2023](https://www.wearedevelopers.com/magazine/263-top-6-hackathons-for-developers-in-2023) - [Best Companies to Work For in France: Top 25 Companies in 2023 ](https://www.wearedevelopers.com/magazine/189-best-companies-to-work-for-in-france-top-25-companies-in-2023) - [Average Salary in France](https://www.wearedevelopers.com/magazine/269-average-salary-in-france) - [What’s the latest in NVIDIA CUDA Python](https://www.wearedevelopers.com/magazine/568-what-s-the-latest-in-nvidia-cuda-python)