Administrateur Cluster IA H/F

GROUPE ALLIANCE
Montpellier, France
6 days ago
Apply on www.hellowork.com
Prepare application

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours

Tech stack

Artificial Intelligence Bash Shell Ubuntu (Operating System) Nvidia CUDA Linux Python (Programming Language) Ansible Prometheus Grafana Kubernetes Docker

Job description

Vous interviendrez sur le MCO du cluster IA, le support aux utilisateurs, la gestion des incidents et l’automatisation des opĂ©rations d’exploitation., Assurer le MCO du cluster IA : GPU, CPU, stockage et rĂ©seau

  • Administrer les environnements Linux et Kubernetes
  • Assurer le support aux utilisateurs et le traitement des incidents
  • GĂ©rer les ressources, quotas, prioritĂ©s et jobs sur la plateforme
  • Participer Ă  la gestion des GPU NVIDIA, drivers, CUDA et MIG
  • Mettre en place et maintenir l’automatisation des opĂ©rations d’exploitation
  • Assurer la supervision et le monitoring de la plateforme
  • Participer au suivi des incidents matĂ©riels et aux Ă©changes avec les mainteneurs
  • Contribuer Ă  l’évolution et Ă  l’optimisation de l’infrastructure IA
  • RĂ©diger et maintenir la documentation et les procĂ©dures d’exploitation

Environnement technique

SystĂšmes : Linux Ubuntu

Orchestration : Kubernetes, Docker

GPU : NVIDIA, CUDA, MIG

Automatisation : Ansible, Bash, Python

Supervision : Prometheus, Grafana

Infrastructure : stockage haute performance, stockage objet, réseaux de clusters

Méthodes : ITIL / ITSM, gestion des incidents et des changements

Requirements

Profil recherchĂ©Formation Bac +5 (École d’IngĂ©nieur, Master ou Ă©quivalent) ExpĂ©rience confirmĂ©e en administration systĂšmes et infrastructures Bonne maĂźtrise de Linux et Kubernetes ExpĂ©rience sur des infrastructures GPU / IA Connaissance de NVIDIA, CUDA et idĂ©alement MIG Bonne maĂźtrise d’Ansible et/ou du scripting Bash / Python ExpĂ©rience en supervision et gestion des incidents Une connaissance des environnements de stockage et rĂ©seaux HPC/IA est apprĂ©ciĂ©e QualitĂ©s attendues :Esprit d’analyse et capacitĂ© de diagnostic Autonomie et rigueur Sens du service et orientation utilisateur RĂ©activitĂ© face aux incidents Aisance dans les environnements techniques complexes Force de proposition, * Formation Bac +5 (École d’IngĂ©nieur, Master ou Ă©quivalent)

  • ExpĂ©rience confirmĂ©e en administration systĂšmes et infrastructures
  • Bonne maĂźtrise de Linux et Kubernetes
  • ExpĂ©rience sur des infrastructures GPU / IA
  • Connaissance de NVIDIA, CUDA et idĂ©alement MIG
  • Bonne maĂźtrise d’Ansible et/ou du scripting Bash / Python
  • ExpĂ©rience en supervision et gestion des incidents
  • Une connaissance des environnements de stockage et rĂ©seaux HPC/IA est apprĂ©ciĂ©e

Qualités attendues :

  • Esprit d’analyse et capacitĂ© de diagnostic
  • Autonomie et rigueur
  • Sens du service et orientation utilisateur
  • RĂ©activitĂ© face aux incidents
  • Aisance dans les environnements techniques complexes
  • Force de proposition

EUR

Ansible Administration systĂšme et rĂ©seau Cluster Prometheus Bash Force de proposition Intelligence artificielle Linux Grafana RĂ©activitĂ© Kubernetes Python Autonomie ITIL Docker Esprit d’analyse

About the company

Alliance Services Plus (AS+) est un acteur de rĂ©fĂ©rence du calcul haute performance (HPC) en France depuis plus de 15 ans. Filiale du groupe GECI, AS+ s’est imposĂ©e comme le spĂ©cialiste reconnu, au coeur des environnements HPC les plus critiques. ImplantĂ©e entre autres sur le campus Teratec, l’entreprise intervient directement au sein des plus grands centres de calcul français, lĂ  oĂč se jouent les enjeux technologiques de demain.

En forte croissance, AS+ opĂšre principalement au forfait avec une exigence Ă©levĂ©e de performance et de rĂ©sultats. Ses consultants interviennent directement au coeur des infrastructures et clusters HPC de ses clients, sur des missions Ă  forte valeur ajoutĂ©e en infrastructure, dĂ©veloppement et support applicatif. Rejoindre AS+, c’est contribuer Ă  des projets stratĂ©giques pour des acteurs majeurs de la recherche, de l’énergie et de l’industrie, tels que le CEA, le CNRS, TotalEnergies ou Michelin, 


Mais AS+, c’est avant tout un collectif d’experts HPC animĂ© par une culture claire et assumĂ©e : “aller plus vite, aller plus loin”. Plus vite dans la comprĂ©hension des enjeux, la prise en main des environnements et l’exĂ©cution. Plus loin dans l’expertise, l’innovation et la qualitĂ© des solutions apportĂ©es. Cette philosophie se traduit au quotidien par une forte exigence technique, un haut niveau d’autonomie et une responsabilitĂ© rĂ©elle confiĂ©e Ă  chaque consultant.

IntĂ©grer AS+, c’est rejoindre une entreprise qui valorise l’excellence, le partage d’expertise et la progression continue. Un environnement oĂč l’on est challengĂ©, soutenu et reconnu, et oĂč chacun construit une carriĂšre HPC solide, ambitieuse et durable., Alliance Services Plus (AS+) recherche un(e) IngĂ©nieur(e) Administration Cluster IA Senior pour accompagner l’un de ses clients dans l’administration et le maintien en conditions opĂ©rationnelles d’une plateforme dĂ©diĂ©e Ă  l’Intelligence Artificielle.

Notre client est un acteur public majeur dans les domaines de la sĂ»retĂ© nuclĂ©aire, de la recherche et de l’expertise scientifique. Ses activitĂ©s s’appuient notamment sur des infrastructures de calcul intensif et des plateformes dĂ©diĂ©es aux usages IA., Alliance Services Plus (AS+) est un acteur de rĂ©fĂ©rence du calcul haute performance (HPC) en France depuis plus de 15 ans. Filiale du groupe GECI, AS+ s’est imposĂ©e comme le spĂ©cialiste reconnu, au coeur des environnements HPC les plus critiques. ImplantĂ©e entre autres sur le campus Teratec, l’entreprise intervient directement au sein des plus grands centres de calcul français, lĂ  oĂč se jouent les enjeux technologiques de demain. En forte croissance, AS+ opĂšre principalement au forfait avec une exigence Ă©levĂ©e de performance et de rĂ©sultats. Ses consultants interviennent directement au coeur des infrastructures et clusters HPC de ses clients, sur des missions Ă  forte valeur ajoutĂ©e en infrastructure, dĂ©veloppement et support applicatif. Rejoindre AS+, c’est contribuer Ă  des projets stratĂ©giques pour des acteurs majeurs de la recherche, de l’énergie et de l’industrie, tels que le CEA, le CNRS, TotalEnergies ou Michelin, 
 Mais AS+, c’est avant tout un collectif d’experts HPC animĂ© par une culture claire et assumĂ©e : “aller plus vite, aller plus loin”. Plus vite dans la comprĂ©hension des enjeux, la prise en main des environnements et l’exĂ©cution. Plus loin dans l’expertise, l’innovation et la qualitĂ© des solutions apportĂ©es. Cette philosophie se traduit au quotidien par une forte exigence technique, un haut niveau d’autonomie et une responsabilitĂ© rĂ©elle confiĂ©e Ă  chaque consultant. IntĂ©grer AS+, c’est rejoindre une entreprise qui valorise l’excellence, le partage d’expertise et la progression continue. Un environnement oĂč l’on est challengĂ©, soutenu et reconnu, et oĂč chacun construit une carriĂšre HPC solide, ambitieuse et durable.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.hellowork.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

52 sec

Running persistent Linux environments directly on Windows

Ben Breard Ben Breard · World Congress 2025

2:07 min

Inspecting default bridge architectures and custom Docker networks

Oliver Seitz Oliver Seitz · World Congress 2025

1:42 min

Automating Skupper deployments using Ansible

Alex Soto Alex Soto · World Congress 2024

2:27 min

Core infrastructure components required for an AI factory

Thomas Schmidt Thomas Schmidt · World Congress 2024

3:55 min

Demonstrating .NET installation on Debian and Azure Linux

Silvano Coriani Silvano Coriani · Europe 2026 Virtual

1:28 min

Bridging AI and cluster control with an MCP server

Erik Koci Erik Koci · Europe 2026 Virtual

Videos

See all

Related articles

See all