Administrador/A Hpc & Storage

Personas y Estrategia
Municipality of Logroño, Spain
5 days ago

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours
Languages
English, Spanish
Experience level
Intermediate

Job location

Municipality of Logroño, Spain

Tech stack

Artificial Intelligence
Amazon Web Services (AWS)
Intelligent Platform Management Interface
Bash
BIOS
Ubuntu (Operating System)
Cloud Engineering
Computer Engineering
Data Centers
Linux
Firmware
General Parallel File Systems
InfiniBand
Python
Natural Language Processing
Remote Direct Memory Access
Red Hat Enterprise Linux - RHEL
Ansible
Prometheus
SAS (Software)
Weka
Grafana
Kubernetes
Slurm
Terraform
Nvme

Job description

El nuevo Centro Nacional de Industrias del Español (CNIE) es una apuesta estratégica del Gobierno de La Rioja para el desarrollo en la región del sector tecnológico asociado a la lengua española.El CNIE es un centro único en España, una organización innovadora que funciona como centro propio de la Fundación para la Transformación de La Rioja, siendo esta última una entidad que forma parte del sector público de la Comunidad Autónoma de La Rioja y que gestiona proyectos de alto valor para el futuro de la región.Los objetivos del CNIE, entre otros, están orientados para dar respuesta a las demandas de la industria y de las instituciones en relación con el uso de la lengua española en el ámbito de la inteligencia artificial.Así, entre sus propósitos están el desarrollo de tecnologías y aplicaciones de inteligencia artificial para el procesamiento del lenguaje natural y los modelos de lenguaje, haciéndolos fiables y éticos, y proporcionando, al mismo tiempo, una oportunidad excepcional para el desarrollo económico de la región como futura referencia a nivel global en la cadena de valor de la Nueva Economía de la Lengua.En este contexto, el CNIE necesita incorporar un/a Administrador/a HPC Storage, que participará en el arranque y puesta en marcha del centro que será referencia de proyectos tecnológicos que vinculan DATOS, IA y LENGUA ESPAÑOLA.El puesto de trabajo ofertado se ubica en Logroño en horario de lunes a viernes de 8.00 a ***** h.Como Administrador/a HPC Storage y en dependencia directa del Director del CNIE, eres la persona de referencia para la operación de los servidores GPU, la red HPC y las plataformas de almacenamiento.Eres el puente entre el mundo HPC (Slurm, MPI, RDMA) y la plataforma cloud-native del CNIE, garantizando máximo rendimiento y fiabilidad del almacenamiento paralelo y los servidores GPU.Trabajarás en la subárea de Operaciones de Centro de Datos dentro de la Dirección de Tecnología e Infraestructura y colaborarás estrechamente con: · El equipo de Ingeniería de Plataforma (SRE) para alinear capacidad física y SLO de servicios.· El/la Responsable de Seguridad y Cumplimiento, aplicando controles ENS en firmware y redes.· La Oficina Técnica externa, documentando lecciones aprendidas y absorbiendo sus procedimientos de mantenimiento preventivo.Durante los primeros meses una OT externa gobernará la ejecución del contrato.Tu misión es absorber ese know-how y garantizar que la infraestructura física rinda al máximo y evolucione sin interrupciones cuando el CNIE asuma la explotación directa.Las responsabilidades que tienes incluyen: · Instalar y poner en servicio nodos GPU, switches InfiniBand/OPA y cabinas NVMe/SAS, siguiendo los runbooks aprobados.· Gestionar firmware, BIOS y refrigeración líquida de racks de alta densidad, asegurando energía y climatización dentro de parámetros PUE objetivo.· Administrar Slurm (particiones, cgroups, QoS) e integrar sus colas con Kubernetes mediante, por ejemplo, Slurm Operator, Volcano o Kueue.· Optimizar el stack MPI/NCCL/UCX sobre RDMA, midiendo latencias ?s y throughput GiB/s.· Monitorizar rendimiento y salud (Prometheus, Grafana, IPMI) y planificar capacidad para cargas IA / HPC.· Automatizar tareas de bare-metal y configuraciones con OpenTofu o herramientas BMC/IPMI.· Diseñar políticas de backup, snapshots y replicación multi-sitio, y probar regularmente los planes de recuperación ante desastres (DRP).· Coordinar la garantía y el soporte de fabricantes, gestionando RMA y actualizaciones de microcódigo.· Elaborar documentación operativa y trasladar conocimiento al resto del equipo del CNIE.Requisitos: · Grado en Ingeniería Informática/Telecomunicaciones o equivalente.· 2 o más años de experiencia administrando entornos HPC, clústeres Slurm/MPI con redes InfiniBand y almacenamiento paralelo.· Experiencia real integrando GPU operators, CSI drivers y device-plugins en Kubernetes.· Conocimientos sólidos de Linux (RHEL/Ubuntu), Bash/Python y herramientas IaC (OpenTofu, Terraform, Ansible).· Capacidad para comunicar problemas técnicos complejos a audiencias no técnicas.· Conocimientos de inglés.Se valorará · Certificaciones RHCE, NVIDIA DGX/DCGM o WekaFS Specialist.· Experiencia con Weka, BeeGFS, GPFS o MinIO-S3 y métricas energéticas (PUE).· Certificación de inglés nivel B2.

Requirements

Requisitos: · Grado en Ingeniería Informática/Telecomunicaciones o equivalente. · 2 o más años de experiencia administrando entornos HPC, clústeres Slurm/MPI con redes InfiniBand y almacenamiento paralelo. · Experiencia real integrando GPU operators, CSI drivers y device-plugins en Kubernetes. · Conocimientos sólidos de Linux (RHEL/Ubuntu), Bash/Python y herramientas IaC (OpenTofu, Terraform, Ansible). · Capacidad para comunicar problemas técnicos complejos a audiencias no técnicas. · Conocimientos de inglés. Se valorará · Certificaciones RHCE, NVIDIA DGX/DCGM o WekaFS Specialist. · Experiencia con Weka, BeeGFS, GPFS o MinIO-S3 y métricas energéticas (PUE). · Certificación de inglés nivel B2.

Apply for this position