Site Reliability Engineer Google Cloud Platform
Role details
Job location
Tech stack
Job description
Im heutigen, dynamischen Umfeld technologischen Wandels sind intelligente IT-, Software- und Systemlösungen von zentraler Bedeutung - in komplexen, sicherheitskritischen und regulierten Technologiefeldern wie Automotive, Defence und der Luft- und Raumfahrt.
Wir vereinen Expertise in Embedded Software, moderner Softwareentwicklung, Cloud-Architekturen, Data & AI Engineering sowie ganzheitlichem Systems Engineering. So entstehen vernetzte Plattformen, smarte Datenanalysen und hochverfügbare Architekturen für komplexe und sicherheitskritische Anwendungen.
In dieser Rolle verantwortest du den stabilen und sicheren Betrieb einer souveränen Google-Cloud-Plattform in einem hochregulierten Umfeld. Als Teil eines Site Reliability Engineering Teams stellst du die Verfügbarkeit, Skalierbarkeit und Performance geschäftskritischer Cloud-Services sicher und arbeitest eng mit internationalen Experten zusammen. Dabei erhältst du die Möglichkeit, tief in die Technologien eines Hyperscalers einzutauchen und an hochverfügbaren Cloud-Infrastrukturen mit höchsten Sicherheitsanforderungen mitzuwirken.
Werde jetzt Teil unseres Teams - in einer internen und unbefristeten Festanstellung als Site Reliability Engineer (m/w/x) Google Cloud Platform mit folgenden Aufgaben am Standort Berlin:
- Überwachung und Sicherstellung von Verfügbarkeit, Skalierbarkeit, Latenz und Effizienz der Cloud-Services anhand definierter SLI/SLOs
- Analyse, Bearbeitung und nachhaltige Behebung von Incidents in produktiven Cloud-Umgebungen
- Teilnahme an einem internationalen Bereitschaftsmodell zur Sicherstellung eines 24/7-Betriebs
- Zusammenarbeit mit internationalen Cloud- und Plattformexperten zur Fehleranalyse und Problemlösung
- Automatisierung operativer Prozesse und kontinuierliche Optimierung von Betriebsabläufen
- Erstellung und Pflege von Dokumentationen, Runbooks und Operational Playbooks
- Durchführung von Post-Mortem-Analysen sowie Ableitung von Verbesserungsmaßnahmen
- Unterstützung beim Betrieb hochverfügbarer Infrastruktur- und Plattformservices mit Verfügbarkeitsanforderungen von bis zu 99,99 % und höher
Requirements
- Abgeschlossenes Studium der Informatik, Ingenieurwissenschaften oder vergleichbare Qualifikation
- Mindestens 3 Jahre Erfahrung im Bereich Site Reliability Engineering, Cloud Operations oder Infrastrukturbetrieb
- Erfahrung in der Automatisierung von Betriebs- und Infrastrukturprozessen
- Kenntnisse im Betrieb kritischer Systeme mit hohen Verfügbarkeitsanforderungen
- Erfahrung in regulierten Umfeldern (z.B. Banking, Versicherungen, Healthcare, Public Sector)
- Sehr gute Deutsch- und gute Englischkenntnisse in Wort und Schrift