Reliability Engineer

Puestocloudlinux
2 days ago

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours
Languages
Spanish

Job location

Tech stack

Backup Devices
Databases
Core Foundation
Data Security
Linux
File Systems
DNS
PostgreSQL
MongoDB
Quorum
Redis
Ansible
Grafana
Firewalls (Computer Science)
Gitlab-ci
Vertica
Terraform
Pagerduty

Job description

de PostgreSQL, ClickHouse, MongoDB y Redis.PostgreSQL es el requisito principal. La experiencia en ClickHouse es una ventaja importante, pero no es un bloqueador inicial. Necesitamos un ingeniero senior con suficiente profundidad en bases de datos, Linux, automatización y respuesta a incidentes para aprender nuestro entorno de ClickHouse rápidamente y operarlo de manera segura.## Responsabilidades* Poseer la fiabilidad de PostgreSQL en producción: diseño de HA, Patroni, PgBouncer, replicación, conmutación por error, actualizaciones, control de vacío/bloat, ajuste de consultas, bloqueos, índices, capacidad, copias de seguridad, PITR y validación de restauración.* Mejorar la recuperación ante desastres y la evidencia operativa: restauraciones probadas, rutas de recuperación documentadas, objetivos RTO/RPO medibles, runbooks y planes de mantenimiento seguros.* Apoyar el patrimonio de bases de datos más amplio: ClickHouse, MongoDB y Redis. Solucionarás incidentes, revisarás cambios de acceso y seguridad de datos, mejorarás la supervisión y aprenderás los patrones de ClickHouse de producción ya en uso.* Automatizar flujos de trabajo de DBA con Ansible, Terraform/OpenTofu, GitLab CI/CD, scripts y runbooks reproducibles para aprovisionamiento, permisos, copias de seguridad, restauraciones, comprobaciones de salud y metadatos de propiedad.* Ayudar a construir capacidades de autoservicio estilo DBaaS para que los equipos de ingeniería puedan solicitar bases de datos, acceso, credenciales y comprobaciones operativas con menos intervención manual de DBA.* Mejorar la observabilidad y la respuesta a incidentes a través de Grafana, métricas, registros, SLOs, reglas de alerta, enrutamiento de Opsgenie y comunicación clara durante problemas de producción.## Lo que define el éxito* Los clústeres de PostgreSQL tienen rutas de copia de seguridad y restauración probadas, paneles útiles, propiedad clara y procedimientos de conmutación por error documentados.* Los tickets de DBA repetidos se convierten en automatización o flujos de trabajo de autoservicio.* El conocimiento operativo de ClickHouse ya no es una dependencia de una sola persona.* Los incidentes de bases de datos tienen propietarios, runbooks, evidencia y rutas de recuperación medibles.* Los equipos de producto e ingeniería obtienen ayuda con las bases de datos más rápido sin sacrificar la seguridad, la auditabilidad o la fiabilidad.## ¿Por qué CloudLinux?* Trabajarás en infraestructura de producción real utilizada en los productos de CloudLinux y TuxCare.* Tendrás un impacto directo en la fiabilidad, la respuesta a incidentes, la experiencia del desarrollador y la resiliencia operativa.* Trabajarás en una cultura de ingeniería asistida por IA donde la automatización, la documentación, Claude, Codex y la cuidadosa verificación humana son parte del modelo operativo diario.##

Requirements

Requisitos### Lo que esperamos de ti* Profunda experiencia práctica con PostgreSQL en entornos de producción críticos para el negocio, típicamente 5+ años o profundidad equivalente.* Sólida comprensión de los aspectos internos y las operaciones de PostgreSQL: MVCC, WAL, transacciones, bloqueos, índices, planificación de consultas, replicación, autovacuum, bloat, actualizaciones mayores, copias de seguridad, PITR y pruebas de restauración.* Experiencia comprobada con bases de datos de alta disponibilidad y capacidad para razonar sobre quórum, riesgo de cerebro dividido (split-brain), conmutación por error, reversión y recuperación.* Fundamentos sólidos de Linux e infraestructura: systemd, redes, almacenamiento, sistemas de archivos, cuellos de botella de CPU/memoria/disco, TLS, DNS, firewalls y resolución de problemas de causa raíz.* Habilidades de automatización con Ansible y scripting. Terraform/OpenTofu, GitLab CI/CD y la entrega basada en merge-requests son ventajas importantes.* Capacidad para soportar más de un motor de base de datos. No necesitas ser un experto en ClickHouse desde el primer día, pero debes e

Apply for this position