Site Reliability Engineer
Markant Gruppe
Offenburg, Germany
2 days ago
Role details
Contract type
Permanent contract Employment type
Full-time (> 32 hours) Working hours
Shift work Languages
English, GermanJob location
Offenburg, Germany
Tech stack
Linux
Disaster Recovery
Distributed Systems
Prometheus
Data Logging
Grafana
Kubernetes
Information Technology
Job description
- Du stellst die Zuverlässigkeit, Verfügbarkeit und Leistungsfähigkeit der Markant Developer Plattform sicher.
- Du entwickelst und betreibst Observability-Lösungen für Monitoring, Logging, Tracing und Alerting.
- Du analysierst Betriebsstörungen, identifizierst deren Ursachen und leitest nachhaltige Massnahmen zur Verbesserung der Stabilität ein.
- Du definierst und etablierst Kennzahlen zur Bewertung von Verfügbarkeit, Performance und Servicequalität und treibst deren kontinuierliche Verbesserung voran.
- Du konzipierst Massnahmen zur Erhöhung der Resilienz, Skalierbarkeit und Ausfallsicherheit unserer Entwicklungsplattform.
- Du planst, koordinierst und führst Disaster-Recovery-Tests durch und bewertest deren Ergebnisse.
- Du unterstützt und befähigst unsere Entwicklungsteams bei der Umsetzung von Reliability- und Observability-Anforderungen.
- Du analysierst und löst komplexe bereichsübergreifende Herausforderungen.
- Du pflegst kontinuierlich Betriebsdokumentationen, Standards und Runbooks.
- Du wirkst an der Rufbereitschaft für die Entwicklungsplattform mit.
Requirements
- Du verfügst über eine abgeschlossene technische Ausbildung, ein Studium im IT-Bereich oder eine vergleichbare Qualifikation.
- Du bringst fundierte Kenntnisse in mindestens einem der folgenden Bereiche mit: Hyperscaler, Kubernetes, Linux sowie Monitoring- und Observability-Lösungen.
- Du hast Erfahrung im Betrieb und in der Optimierung komplexer IT-Plattformen und verteilter Systeme.
- Du kennst dich mit Monitoring-, Logging- und Alerting-Lösungen wie Grafana, Prometheus, Loki, Mimir, Tempo oder vergleichbaren Technologien aus.
- Du verfügst über Kenntnisse in den Bereichen Automatisierung, Infrastructure as Code sowie modernen Betriebs- und Deploymentverfahren.
- Du hast Erfahrung in der Analyse und Behebung komplexer Störungen sowie in der nachhaltigen Ursachenanalyse.
- Du zeichnest dich durch ein ausgeprägtes analytisches Denkvermögen und starke Problemlösungsfähigkeiten aus.
- Du arbeitest eigenverantwortlich, selbstständig und bist gleichzeitig ein echter Teamplayer.
- Du überzeugst durch eine kunden- und lösungsorientierte Arbeitsweise.
- Du verfügst über sehr gute Deutsch- und gute Englischkenntnisse.