Administrateur Cluster IA H/F
- Discuss this with your agent
- Open in Claude
- Open in ChatGPT
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Role details
Tech stack
Job description
Positionnement : Infrastructure et MCO - socle technique. Point d’entrée des demandes utilisateurs et tour de contrôle du suivi., Garantir la disponibilité, la performance et la stabilité du cluster IA (GPU / CPU / réseau / stockage), automatiser son exploitation et assurer le support utilisateur.
Activités principales
Maintien en conditions opérationnelles
- MCO du cluster IA : noeuds GPU/CPU, stockage, réseau
- Administration Linux (Ubuntu) : installation, configuration
- Exploitation Kubernetes : déploiement, scaling, haute disponibilité
- Gestion des mises à jour : OS, drivers NVIDIA, versions Kubernetes
- Gestion des jobs : scheduling GPU, quotas, priorités
- Équilibrage des ressources, gestion des pics d’activité, des priorités et des conflits
Supervision et gestion des incidents
- Supervision et monitoring (Prometheus, Grafana)
- Gestion des incidents, analyse fine, traitement des problèmes, post-mortem, amélioration continue
- Production de la « météo quotidienne » du cluster
- Suivi des pannes matérielles : ouverture de tickets auprès des mainteneurs et éditeurs, relances, application des procédures constructeur
- Demandes de geste de proximité auprès de l’infogérant général (N1)
Support utilisateur (niveaux 1 et 2 IA)
- Prise en compte des demandes formulées dans GIPSI et aiguillées par l’infogérant général
- Première analyse, résolution ou escalade vers l’expertise ; suivi et relance des tickets
- Gestion des accès, rôles, droits et habilitations sur les plateformes, projets et ressources IA
- Modification des permissions sur les espaces de stockage, jeux de données, modèles et référentiels partagés
- Création et mise à disposition d’environnements de développement et d’exécution (notebooks, espaces de travail, conteneurs)
- Modification des quotas de stockage ou de consommation des services IA
Automatisation et documentation
- Automatisation : Ansible, scripts Bash et Python
- Dossiers d’exploitation, procédures et guides utilisateurs, entretien du WIKI IA
- Fichier de suivi des matériels IA (production, localisation, date de fin de maintenance)
- Élaboration d’états et de tableaux de bord
Requirements
Ansible Prometheus Bash Intelligence artificielle Linux Ubuntu Kubernetes Python
About the company
Rejoindre SECURINFOR, c’est intégrer une entreprise dynamique, en pleine évolution, offrant un environnement de travail structuré, des missions variées et de réelles perspectives d’évolution selon votre engagement et vos performances.
Apply for this position
This job is hosted externally. Click below to view the full posting and apply.
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Good distractions
Talks and stories from around this role — technically off-topic, practically not.
Moments
Explore playlistsVideos
See allRelated articles
See all
Best Companies to Work For in France: Top 25 Companies in 2023Â
Top-Paying Tech Jobs (with Salaries)
Dev Digest 121 - AI goes offline
How We Built a Worry-Free System That Runs for 10+ Years – And What We’d Do Again