Administrateur Cluster IA H/F

Securinfor
Fontenay-aux-Roses, France
15 days ago
Apply on www.hellowork.com
Prepare application

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours

Tech stack

Artificial Intelligence Bash Shell Ubuntu (Operating System) Python (Programming Language) Linux System Administration Ansible Prometheus Grafana Kubernetes Wikis

Job description

Positionnement : Infrastructure et MCO - socle technique. Point d’entrée des demandes utilisateurs et tour de contrôle du suivi., Garantir la disponibilité, la performance et la stabilité du cluster IA (GPU / CPU / réseau / stockage), automatiser son exploitation et assurer le support utilisateur.

Activités principales

Maintien en conditions opérationnelles

  • MCO du cluster IA : noeuds GPU/CPU, stockage, réseau
  • Administration Linux (Ubuntu) : installation, configuration
  • Exploitation Kubernetes : déploiement, scaling, haute disponibilité
  • Gestion des mises à jour : OS, drivers NVIDIA, versions Kubernetes
  • Gestion des jobs : scheduling GPU, quotas, priorités
  • Équilibrage des ressources, gestion des pics d’activité, des priorités et des conflits

Supervision et gestion des incidents

  • Supervision et monitoring (Prometheus, Grafana)
  • Gestion des incidents, analyse fine, traitement des problèmes, post-mortem, amélioration continue
  • Production de la « météo quotidienne » du cluster
  • Suivi des pannes matérielles : ouverture de tickets auprès des mainteneurs et éditeurs, relances, application des procédures constructeur
  • Demandes de geste de proximité auprès de l’infogérant général (N1)

Support utilisateur (niveaux 1 et 2 IA)

  • Prise en compte des demandes formulées dans GIPSI et aiguillées par l’infogérant général
  • Première analyse, résolution ou escalade vers l’expertise ; suivi et relance des tickets
  • Gestion des accès, rôles, droits et habilitations sur les plateformes, projets et ressources IA
  • Modification des permissions sur les espaces de stockage, jeux de données, modèles et référentiels partagés
  • Création et mise à disposition d’environnements de développement et d’exécution (notebooks, espaces de travail, conteneurs)
  • Modification des quotas de stockage ou de consommation des services IA

Automatisation et documentation

  • Automatisation : Ansible, scripts Bash et Python
  • Dossiers d’exploitation, procédures et guides utilisateurs, entretien du WIKI IA
  • Fichier de suivi des matériels IA (production, localisation, date de fin de maintenance)
  • Élaboration d’états et de tableaux de bord

Requirements

Ansible Prometheus Bash Intelligence artificielle Linux Ubuntu Kubernetes Python

About the company

Rejoindre SECURINFOR, c’est intégrer une entreprise dynamique, en pleine évolution, offrant un environnement de travail structuré, des missions variées et de réelles perspectives d’évolution selon votre engagement et vos performances.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.hellowork.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

1:42 min

Automating Skupper deployments using Ansible

Alex Soto Alex Soto · World Congress 2024

2:45 min

Securing non-developer workstations and driving organizational adoption

Marcus Wermuth Marcus Wermuth · World Congress 2026 Europe

4:44 min

Evaluating documentation folders versus Git submodules and wikis

Roman Liukevich Roman Liukevich · Europe 2026 Virtual

10:40 min

Visualizing Prometheus open metrics using custom Grafana dashboards

Stijn Polfliet · LIVE

9:55 min

Demonstrating natural language cluster management and troubleshooting

Erik Koci Erik Koci · Europe 2026 Virtual

2:17 min

Finding educational resources for blockchain programming

Liu Xiaohui · LIVE

Videos

See all

Related articles

See all