Reliability Engineer

Puestocloudlinux
Spain
25 days ago

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours
Job source

Tech stack

Backup Devices Databases Core Foundation Data Security Linux File Systems Domain Name System (DNS) PostgreSQL MongoDB Quorum Redis Ansible
+6 more
Grafana Firewalls (Computer Science) Gitlab-ci Vertica Terraform Pagerduty

Job description

de PostgreSQL, ClickHouse, MongoDB y Redis.PostgreSQL es el requisito principal. La experiencia en ClickHouse es una ventaja importante, pero no es un bloqueador inicial. Necesitamos un ingeniero senior con suficiente profundidad en bases de datos, Linux, automatización y respuesta a incidentes para aprender nuestro entorno de ClickHouse rápidamente y operarlo de manera segura.## Responsabilidades* Poseer la fiabilidad de PostgreSQL en producción: diseño de HA, Patroni, PgBouncer, replicación, conmutación por error, actualizaciones, control de vacío/bloat, ajuste de consultas, bloqueos, índices, capacidad, copias de seguridad, PITR y validación de restauración.* Mejorar la recuperación ante desastres y la evidencia operativa: restauraciones probadas, rutas de recuperación documentadas, objetivos RTO/RPO medibles, runbooks y planes de mantenimiento seguros.* Apoyar el patrimonio de bases de datos más amplio: ClickHouse, MongoDB y Redis. Solucionarás incidentes, revisarás cambios de acceso y seguridad de datos, mejorarás la supervisión y aprenderás los patrones de ClickHouse de producción ya en uso.* Automatizar flujos de trabajo de DBA con Ansible, Terraform/OpenTofu, GitLab CI/CD, scripts y runbooks reproducibles para aprovisionamiento, permisos, copias de seguridad, restauraciones, comprobaciones de salud y metadatos de propiedad.* Ayudar a construir capacidades de autoservicio estilo DBaaS para que los equipos de ingeniería puedan solicitar bases de datos, acceso, credenciales y comprobaciones operativas con menos intervención manual de DBA.* Mejorar la observabilidad y la respuesta a incidentes a través de Grafana, métricas, registros, SLOs, reglas de alerta, enrutamiento de Opsgenie y comunicación clara durante problemas de producción.## Lo que define el éxito* Los clústeres de PostgreSQL tienen rutas de copia de seguridad y restauración probadas, paneles útiles, propiedad clara y procedimientos de conmutación por error documentados.* Los tickets de DBA repetidos se convierten en automatización o flujos de trabajo de autoservicio.* El conocimiento operativo de ClickHouse ya no es una dependencia de una sola persona.* Los incidentes de bases de datos tienen propietarios, runbooks, evidencia y rutas de recuperación medibles.* Los equipos de producto e ingeniería obtienen ayuda con las bases de datos más rápido sin sacrificar la seguridad, la auditabilidad o la fiabilidad.## ¿Por qué CloudLinux?* Trabajarás en infraestructura de producción real utilizada en los productos de CloudLinux y TuxCare.* Tendrás un impacto directo en la fiabilidad, la respuesta a incidentes, la experiencia del desarrollador y la resiliencia operativa.* Trabajarás en una cultura de ingeniería asistida por IA donde la automatización, la documentación, Claude, Codex y la cuidadosa verificación humana son parte del modelo operativo diario.##

Requirements

Requisitos### Lo que esperamos de ti* Profunda experiencia práctica con PostgreSQL en entornos de producción críticos para el negocio, típicamente 5+ años o profundidad equivalente.* Sólida comprensión de los aspectos internos y las operaciones de PostgreSQL: MVCC, WAL, transacciones, bloqueos, índices, planificación de consultas, replicación, autovacuum, bloat, actualizaciones mayores, copias de seguridad, PITR y pruebas de restauración.* Experiencia comprobada con bases de datos de alta disponibilidad y capacidad para razonar sobre quórum, riesgo de cerebro dividido (split-brain), conmutación por error, reversión y recuperación.* Fundamentos sólidos de Linux e infraestructura: systemd, redes, almacenamiento, sistemas de archivos, cuellos de botella de CPU/memoria/disco, TLS, DNS, firewalls y resolución de problemas de causa raíz.* Habilidades de automatización con Ansible y scripting. Terraform/OpenTofu, GitLab CI/CD y la entrega basada en merge-requests son ventajas importantes.* Capacidad para soportar más de un motor de base de datos. No necesitas ser un experto en ClickHouse desde el primer día, pero debes e

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on es.trabajo.org

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

1:34 min

Pivoting careers into specialized platform engineering roles

Xavier Portilla Edo · LIVE

1:06 min

Applying traditional quorum systems to LLM reliability

Werner Vogels Werner Vogels +1 · WWC Europe 2026

3:55 min

Demonstrating semantic routing thresholds with the Redis vector library

52 sec

Running persistent Linux environments directly on Windows

Ben Breard Ben Breard · WWC 2025

1:50 min

Ensuring survivability using raft-based synchronous replication

Wei Hu Wei Hu · WWC 2025

3:42 min

Comparing in-memory and Redis storage for cache scalability

Simone Sanfratello · WWC 2022

Videos

See all

Related articles

See all