Ingénieur Système Hpc - Gpu - Slurm Réf. 2026-1400 H/F

Sorbonne Université
Paris, France
19 days ago
Apply on www.hellowork.com
Prepare application

Role details

Contract type
Temporary contract
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours

Tech stack

Proxmox Artificial Intelligence User Authentication Bash Shell Nvidia CUDA Debian Linux Linux File Systems Python (Programming Language) Lightweight Directory Access Protocols (LDAP) Ansible Tensorflow
+11 more
Prometheus Virtual Local Area Networks Ceph (Software) Pytorch Grafana Gitlab Git Gitlab-ci Slurm Docker Network Optimization

Job description

Le candidat ou la candidate rejoint une équipe en charge de l’administration, de la maintenance et de l’évolution du cluster PostGenAI@Paris, projet académique majeur porté par Sorbonne Université, lauréat de l’appel « IA-Cluster » (France 2030), doté de 35 M€ sur 5 ans. Ce cluster rassemble un large consortium d’acteurs académiques (CNRS, Inria, Inserm, UTC, MNHN, AP-HP, Cnam, Sciences Po, Onera…) et plus de 60 partenaires industriels, avec pour objectif de devenir un pôle d’excellence international en IA post-générative à l’horizon 2030.

L’infrastructure HPC repose sur des noeuds GPU NVIDIA sous Debian GNU/Linux, avec l’ordonnanceur SLURM pour la gestion des ressources. Elle répond aux besoins de recherche et de formation en IA du consortium.

Stack technique principale : Debian GNU/Linux, GPU NVIDIA (CUDA), SLURM, réseau 25/100G, stockage NFS/Ceph, supervision Prometheus/Grafana, automatisation Ansible/Bash/Python, authentification SSH/LDAP/SSO., 1. Administration système

  • Déploiement et maintenance des noeuds de calcul GPU sous Debian
  • Déploiement et maintenance de noeuds proxmox, vm et docker
  • Gestion des mises à jour système, des pilotes NVIDIA et des librairies CUDA
  • Configuration et optimisation du réseau haute performance (bonding, VLAN)
  • Mise en oeuvre et gestion des systèmes de fichiers distribués (NFS, CEPH, CephFS)
  • Automatisation des déploiements via Ansible
  1. Administration SLURM
  • Installation, configuration et mise à jour de SLURM (slurmctld, slurmd, slurmdbd)
  • Définition des partitions, QOS, comptes et limites de ressources
  • Intégration des GPU NVIDIA dans les ressources SLURM (GRES)
  • Surveillance des jobs, diagnostics et interventions sur les noeuds en défaut
  • Rédaction et mise à jour des procédures SLURM à destination des utilisateurs
  1. Support utilisateurs et opérateurs
  • Support de niveau 2/3 pour les utilisateurs de la plateforme HPC
  • Accompagnement des utilisateurs sur l’optimisation de leurs soumissions SLURM
  • Participation aux réunions techniques et rédaction des comptes-rendus
  • Rédaction de la documentation technique et des runbooks
  1. Supervision et performance
  • Mise en place et maintenance des outils de supervision (Prometheus, Grafana)
  • Analyse des performances GPU (utilisation, mémoire, température, bande passante NVLink)
  • Optimisation des politiques d’ordonnancement selon la charge de la plateforme
  • Gestion des incidents et participation aux astreintes selon planning

Requirements

Compétences techniques indispensables :Solide maîtrise de Linux/Debian : administration système, packaging, systemd, réseauExpérience confirmée sur SLURM : configuration, partitions, GRES GPU, accountingBonne connaissance de l’écosystème NVIDIA : drivers, CUDA, NVML, DCGMMaîtrise des outils d’automatisation : Ansible, Bash, PythonExpérience sur les réseaux : Bonding, Vlan, routageCompétences appréciées :Connaissance de systèmes de fichiers distribués : Ceph, cephfsPratique de la supervision avec Prometheus, Grafana, AlertmanagerNotions de MPI (OpenMPI, MVAPICH2) et de librairies de calcul (cuBLAS, NCCL)Expérience avec des frameworks IA/ML : PyTorch, TensorFlow (usage sur HPC)Connaissances en gestion de version : Git, GitLab CIQualités personnelles :Rigueur, méthode et sens de la documentationAutonomie et capacité à gérer les priorités en environnement de productionBon relationnel et goût pour le travail en équipeCuriosité technique et veille active sur l’écosystème HPC/GPU

Bienvenue chez Sorbonne Université- Services Universitaires

Dans un contexte national et international marqué par la compétition autour de l’intelligence artificielle, Sorbonne Université a créé le Sorbonne Cluster for Artificial Intelligence (SCAI), qui réunit un ensemble stratégique de disciplines de l’IA moderne. Son ambition est de renforcer l’excellence de la recherche interdisciplinaire en favorisant les échanges entre chercheurs, enseignants, étudiants et partenaires industriels.Le candidat ou la candidate rejoint une équipe en charge de l’administration, de la maintenance et de l’évolution du cluster PostGenAI@Paris, projet académique majeur porté par Sorbonne Université, lauréat de l’appel « IA-Cluster » (France 2030), doté de 35 M€ sur 5 ans. Ce cluster rassemble un large consortium d’acteurs académiques (CNRS, Inria, Inserm, UTC, MNHN, AP-HP, Cnam, Sciences Po, Onera…) et plus de 60 partenaires industriels, avec pour objectif de devenir un pôle d’excellence international en IA post-générative à l’horizon 2030.L’infrastructure HPC repose sur des noeuds GPU NVIDIA sous Debian GNU/Linux, avec l’ordonnanceur SLURM pour la gestion des ressources. Elle répond aux besoins de recherche et de formation en IA du consortium.Stack technique principale : Debian GNU/Linux, GPU NVIDIA (CUDA), SLURM, réseau 25/100G, stockage NFS/Ceph, supervision Prometheus/Grafana, automatisation Ansible/Bash/Python, authentification SSH/LDAP/SSO., * Solide maîtrise de Linux/Debian : administration système, packaging, systemd, réseau

  • Expérience confirmée sur SLURM : configuration, partitions, GRES GPU, accounting
  • Bonne connaissance de l’écosystème NVIDIA : drivers, CUDA, NVML, DCGM
  • Maîtrise des outils d’automatisation : Ansible, Bash, Python
  • Expérience sur les réseaux : Bonding, Vlan, routage

Compétences appréciées :

  • Connaissance de systèmes de fichiers distribués : Ceph, cephfs
  • Pratique de la supervision avec Prometheus, Grafana, Alertmanager
  • Notions de MPI (OpenMPI, MVAPICH2) et de librairies de calcul (cuBLAS, NCCL)
  • Expérience avec des frameworks IA/ML : PyTorch, TensorFlow (usage sur HPC)
  • Connaissances en gestion de version : Git, GitLab CI

Qualités personnelles :

  • Rigueur, méthode et sens de la documentation
  • Autonomie et capacité à gérer les priorités en environnement de production
  • Bon relationnel et goût pour le travail en équipe
  • Curiosité technique et veille active sur l’écosystème HPC/GPU

EUR

Ansible Administration système et réseau Prometheus Bash packaging Qualité de service (QoS) Linux Routage Grafana Git Création d’une base documentaire Analyse de la performance de la promotion Debian Travail en équipe Python Autonomie VLAN NFS

About the company

Dans un contexte national et international marqué par la compétition autour de l’intelligence artificielle, Sorbonne Université a créé le Sorbonne Cluster for Artificial Intelligence (SCAI), qui réunit un ensemble stratégique de disciplines de l’IA moderne. Son ambition est de renforcer l’excellence de la recherche interdisciplinaire en favorisant les échanges entre chercheurs, enseignants, étudiants et partenaires industriels.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.hellowork.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

52 sec

Running persistent Linux environments directly on Windows

Ben Breard Ben Breard · World Congress 2025

2:22 min

Infrastructure barriers and compliance risks in research

Jeremy Murray Jeremy Murray · World Congress 2026 Europe

6:21 min

Investigating push inefficiencies with upstream Git experts

Jonathan Creamer · Coffee With Developers

3:09 min

Balancing data science skillings alongside systems engineering rigor

Nico Schmidt · LIVE

3:55 min

Demonstrating .NET installation on Debian and Azure Linux

Silvano Coriani Silvano Coriani · Europe 2026 Virtual

1:51 min

Managing GPU quotas and multi-tenancy with Kueue

Jeremy Murray Jeremy Murray · World Congress 2026 Europe

Videos

See all

Related articles

See all