Site Reliability Engineer

Markant Gruppe
Offenburg, Germany
2 days ago

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Shift work
Languages
English, German

Job location

Offenburg, Germany

Tech stack

Linux
Disaster Recovery
Distributed Systems
Prometheus
Data Logging
Grafana
Kubernetes
Information Technology

Job description

  • Du stellst die Zuverlässigkeit, Verfügbarkeit und Leistungsfähigkeit der Markant Developer Plattform sicher.
  • Du entwickelst und betreibst Observability-Lösungen für Monitoring, Logging, Tracing und Alerting.
  • Du analysierst Betriebsstörungen, identifizierst deren Ursachen und leitest nachhaltige Massnahmen zur Verbesserung der Stabilität ein.
  • Du definierst und etablierst Kennzahlen zur Bewertung von Verfügbarkeit, Performance und Servicequalität und treibst deren kontinuierliche Verbesserung voran.
  • Du konzipierst Massnahmen zur Erhöhung der Resilienz, Skalierbarkeit und Ausfallsicherheit unserer Entwicklungsplattform.
  • Du planst, koordinierst und führst Disaster-Recovery-Tests durch und bewertest deren Ergebnisse.
  • Du unterstützt und befähigst unsere Entwicklungsteams bei der Umsetzung von Reliability- und Observability-Anforderungen.
  • Du analysierst und löst komplexe bereichsübergreifende Herausforderungen.
  • Du pflegst kontinuierlich Betriebsdokumentationen, Standards und Runbooks.
  • Du wirkst an der Rufbereitschaft für die Entwicklungsplattform mit.

Requirements

  • Du verfügst über eine abgeschlossene technische Ausbildung, ein Studium im IT-Bereich oder eine vergleichbare Qualifikation.
  • Du bringst fundierte Kenntnisse in mindestens einem der folgenden Bereiche mit: Hyperscaler, Kubernetes, Linux sowie Monitoring- und Observability-Lösungen.
  • Du hast Erfahrung im Betrieb und in der Optimierung komplexer IT-Plattformen und verteilter Systeme.
  • Du kennst dich mit Monitoring-, Logging- und Alerting-Lösungen wie Grafana, Prometheus, Loki, Mimir, Tempo oder vergleichbaren Technologien aus.
  • Du verfügst über Kenntnisse in den Bereichen Automatisierung, Infrastructure as Code sowie modernen Betriebs- und Deploymentverfahren.
  • Du hast Erfahrung in der Analyse und Behebung komplexer Störungen sowie in der nachhaltigen Ursachenanalyse.
  • Du zeichnest dich durch ein ausgeprägtes analytisches Denkvermögen und starke Problemlösungsfähigkeiten aus.
  • Du arbeitest eigenverantwortlich, selbstständig und bist gleichzeitig ein echter Teamplayer.
  • Du überzeugst durch eine kunden- und lösungsorientierte Arbeitsweise.
  • Du verfügst über sehr gute Deutsch- und gute Englischkenntnisse.

Apply for this position