Senior Site Reliability Engineer (SRE)

Ai
Berlin, Germany
2 days ago

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours
Languages
English, German
Experience level
Senior

Job location

Berlin, Germany

Tech stack

Artificial Intelligence
Software as a Service
Cloud Computing
Data Centers
VMware ESX Servers
Octopus Deploy
OpenStack
Virtual Local Area Networks
vSphere
Ceph
Load Balancing
Autoscaling
Kubernetes
Information Technology

Job description

n

Als Senior Site Reliability Engineer (SRE) sorgst du dafür, dass unsere Systeme über diese Transformation hinweg schnell, verfügbar und skalierbar bleiben. Du arbeitest mit dem Hosting-Team und erfahrenen Engineers zusammen und gestaltest den Weg zu einer modernen SaaS-Company aktiv mit. \n \n

  • Du definierst und verantwortest SLOs, SLIs und Error Budgets über beide Produkte hinweg und triffst datenbasierte Entscheidungen zu Reliability und Performance.\n
  • Du treibst Incident Response voran: schnelle Detektion, klare Kommunikation, blameless Postmortems und nachhaltige Follow-ups.\n
  • Du reduzierst manuelle Arbeit konsequent durch Automatisierung und GitOps (z. B. Argo CD / Flux) und baust self-healing sowie self-service Fähigkeiten aus.\n
  • Du unterstützt den Aufbau eines NG Search Operators (Custom Kubernetes Operator / CRDs) und die Einführung von Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler).\n
  • Du entwickelst unsere Observability weiter - Metrics, Logs, Traces, Alerting und Runbooks, die on-call wirklich helfen.\n
  • Du planst Kapazität und Kosten über On-Premise (Frankfurt, Stockholm) und Cloud hinweg - inklusive Burst-Szenarien in die Public Cloud.\n
  • Du nutzt AI-Tools, um Diagnose, Alerting und operative Workflows spürbar zu\n

\n

Requirements

  • Erfahrung als SRE, Infrastructure oder Production Engineer in einem SaaS- oder Plattform-Umfeld - oder ein starker Software-/Operations-Hintergrund mit klarem Willen, in die SRE-Rolle hineinzuwachsen.\n
  • Solides Verständnis von SLOs, Error Budgets, Incident Management und Observability.\n
  • Hands-on Erfahrung mit Kubernetes und Interesse an Cluster-Lifecycle, Upgrades und Operator-Pattern.\n
  • Erfahrung oder starkes Interesse an Harvester bzw. vergleichbaren HCI-/Virtualisierungsplattformen (KubeVirt, vSphere/ESXi, OpenStack).\n
  • Vertrautheit mit GitOps (Argo CD / Flux), Container Storage (Longhorn, Ceph) und Kubernetes Networking (Load Balancing, Ingress).\n
  • Kenntnisse zu Auto-Scaling-Primitiven (HPA, VPA, Cluster Autoscaler, KEDA) und Kapazitätsplanung on-prem und in der Cloud.\n
  • Verständnis für Netzwerke in produktionsnahen Rechenzentren (u. a. VLAN).\n
  • Ausgeprägter Automatisierungsinstinkt und eine Haltung, Toil strukturell zu eliminieren.\n
  • Praktische Erfahrung im Einsatz von AI-Tools im operativen Betrieb.\n
  • Sehr gute Englischkenntnisse; Deutsch von Vorteil.\n

Benefits & conditions

n

THE JOY OF WORKING WITH US

\n \n

  • Impact from day one: Deine Arbeit wirkt direkt auf die Umsätze führender eCommerce-Marken in Europa.\n
  • Moderner Tech-Stack: Kubernetes, Harvester, GitOps, Auto-Scaling und ein spannender Weg in Richtung Cloud - mit Raum, Dinge neu und richtig zu bauen.\n
  • AI-first Mindset: Wir nutzen AI nicht als Buzzword, sondern als festen Bestandteil unserer täglichen Arbeit.\n
  • Ownership & Wachstum: Klare Verantwortung, kurze Entscheidungswege und die Möglichkeit, deine Rolle aktiv mitzugestalten.\n
  • Flexibles Arbeiten: Hybrides Arbeitsmodell mit Fokus auf Ergebnisse.\n
  • Starkes Team: Erfahrene Engineers, offene Feedback-Kultur und ein Umfeld, in dem Reliability als Engineering-Disziplin ernst genommen wird.\n

\n

Standort

\n

Apply for this position