Senior Site Reliability Engineer (all genders)
FACT-Finder
Pforzheim, Germany
yesterday
Role details
Contract type
Permanent contract Employment type
Full-time (> 32 hours) Working hours
Regular working hours Languages
English, German Experience level
SeniorJob location
Pforzheim, Germany
Tech stack
Artificial Intelligence
Software as a Service
Cloud Computing
Data Centers
VMware ESX Servers
Octopus Deploy
OpenStack
Virtual Local Area Networks
vSphere
Ceph
Load Balancing
Autoscaling
Kubernetes
Job description
- Du definierst und verantwortest SLOs, SLIs und Error Budgets über beide Produkte hinweg und triffst datenbasierte Entscheidungen zu Reliability und Performance.
- Du treibst Incident Response voran: schnelle Detektion, klare Kommunikation, blameless Postmortems und nachhaltige Follow-ups.
- Du reduzierst manuelle Arbeit konsequent durch Automatisierung und GitOps (z. B. Argo CD / Flux) und baust self-healing sowie self-service Fähigkeiten aus.
- Du unterstützt den Aufbau eines NG Search Operators (Custom Kubernetes Operator / CRDs) und die Einführung von Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler).
- Du entwickelst unsere Observability weiter - Metrics, Logs, Traces, Alerting und Runbooks, die on-call wirklich helfen.
- Du planst Kapazität und Kosten über On-Premise (Frankfurt, Stockholm) und Cloud hinweg - inklusive Burst-Szenarien in die Public Cloud.
- Du nutzt AI-Tools, um Diagnose, Alerting und operative Workflows spürbar zu
Requirements
- Erfahrung als SRE, Infrastructure oder Production Engineer in einem SaaS- oder Plattform-Umfeld - oder ein starker Software-/Operations-Hintergrund mit klarem Willen, in die SRE-Rolle hineinzuwachsen.
- Solides Verständnis von SLOs, Error Budgets, Incident Management und Observability.
- Hands-on Erfahrung mit Kubernetes und Interesse an Cluster-Lifecycle, Upgrades und Operator-Pattern.
- Erfahrung oder starkes Interesse an Harvester bzw. vergleichbaren HCI-/Virtualisierungsplattformen (KubeVirt, vSphere/ESXi, OpenStack).
- Vertrautheit mit GitOps (Argo CD / Flux), Container Storage (Longhorn, Ceph) und Kubernetes Networking (Load Balancing, Ingress).
- Kenntnisse zu Auto-Scaling-Primitiven (HPA, VPA, Cluster Autoscaler, KEDA) und Kapazitätsplanung on-prem und in der Cloud.
- Verständnis für Netzwerke in produktionsnahen Rechenzentren (u. a. VLAN).
- Ausgeprägter Automatisierungsinstinkt und eine Haltung, Toil strukturell zu eliminieren.
- Praktische Erfahrung im Einsatz von AI-Tools im operativen Betrieb.
- Sehr gute Englischkenntnisse; Deutsch von Vorteil.