Senior Platform Operations Engineer / Site Reliability Engineer

n_value group
Germany
6 days ago
Apply on de.indeed.com
Prepare application

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience level
Expert
Working hours
Shift work
Languages
English
Job source

Tech stack

Systems Engineering Bash Shell Cloud Computing Communications Protocols Continuous Integration Linux Elasticsearch Information Technology Operations Python (Programming Language) Networking Basics Reliability Engineering Prometheus
+7 more
Software Engineering Grafana Git Kubernetes Restful APIs Elk Stack Jenkins

Job description

Sichere und betreibe moderne Plattformen auf Enterprise-Niveau.

Du begeisterst dich für hochverfügbare Plattformen, Monitoring-Lösungen und den stabilen Betrieb komplexer Kubernetes-Umgebungen? Dann suchen wir genau dich.

Als Senior Platform Operations Engineer (m/w/d) übernimmst du eine zentrale Rolle im Betrieb und der Weiterentwicklung moderner Plattform- und Observability-Lösungen. Dein Fokus liegt nicht auf klassischer Softwareentwicklung, sondern auf der Sicherstellung von Stabilität, Verfügbarkeit und Performance geschäftskritischer Systeme.

Du arbeitest an den Themen Monitoring, Observability, Incident Management, Kubernetes Operations sowie Automation im Betriebsumfeld und sorgst gemeinsam mit unserem Team für einen zuverlässigen Plattformbetrieb. Deine Aufgaben

  • Betrieb, Betreuung und Weiterentwicklung von Monitoring- und Observability-Plattformen
  • Administration und Optimierung von Prometheus, Grafana sowie OpenSearch / ELK
  • Überwachung produktiver Systemlandschaften und kontinuierliche Verbesserung von Monitoring- und Alerting-Konzepten
  • Bearbeitung von Incidents sowie Unterstützung bei der Wiederherstellung kritischer Services
  • Durchführung von Root Cause Analysen und nachhaltige Beseitigung von Störungsursachen
  • Unterstützung bei Major Incidents und Koordination technischer Lösungsmaßnahmen
  • Betrieb und Optimierung containerisierter Plattformen auf Basis von Kubernetes
  • Unterstützung von CI/CD-Prozessen mit Jenkins und ArgoCD
  • Erstellung, Pflege und Weiterentwicklung von Runbooks, Betriebsprozessen und technischer Dokumentation
  • Automatisierung wiederkehrender Betriebsaufgaben
  • Teilnahme an Rufbereitschaften und Schichtmodellen in einer 24x7-Betriebsorganisation

Requirements

Must-have

  • Mehrjährige Erfahrung im Bereich Platform Operations, Site Reliability Engineering, System Engineering oder IT Operations
  • Bereitschaft zur Durchführung bzw. Vorliegen einer Sicherheitsüberprüfung SÜ2
  • Sehr gute Kenntnisse in Linux-basierten Umgebungen
  • Verständnis für Kubernetes und containerisierte Plattformen
  • Praxiserfahrung mit:
  • Prometheus
  • Grafana
  • ELK Stack oder OpenSearch
  • Elasticsearch oder OpenSearch
  • Erfahrung im Monitoring, Alerting und Observability-Umfeld
  • Gute Kenntnisse von Netzwerkgrundlagen und Kommunikationsprotokollen
  • Erfahrung im Umgang mit REST APIs
  • Sicherer Umgang mit Git
  • Analytische Herangehensweise bei Fehleranalysen und Störungsbehebung
  • Gute Englischkenntnisse in Wort und Schrift
  • Bereitschaft zur Teilnahme an Rufbereitschaften und Schichtbetrieb

Nice-to-have

  • Erfahrung mit ArgoCD
  • Kenntnisse in Jenkins
  • Erfahrung mit Helm
  • Bash-Scripting
  • Python für Betriebsautomation und Operational Excellence
  • Erfahrung im Bereich Site Reliability Engineering (SRE)
  • Kenntnisse moderner Cloud- oder Plattformarchitekturen

Benefits & conditions

Unsere erfolgreiche Geschichte wollen wir mit dir als Verstärkung unseres dynamischen Team weiter stärken. Bei uns erwartet dich ein Umfeld, bei dem du und deine Entwicklung im Mittelpunkt stehen. Das gelingt nur mit innovativen Ideen, Engagement und herausragendem Service. Werde Teil unseres Teams und gestalte die Zukunft der Netlution Gruppe mit! Unsere Benefits:

Unbefristeter Arbeitsvertrag Attraktive Vergütung Weiterbildungen

Hybrid und Full Remote Modell PC Ausstattung

About the company

Die Netlution Gruppe mit über 250 Experten und der Netlution Enterprise Services als zentraler Bestandteil der Gruppe, versteht sich als Premium Partner für IT-Infrastruktur- und Application Services führender Unternehmen der deutschen Wirtschaft. Seit 2001 haben wir umfangreiche Erfahrungen gesammelt. Heute liegt der Schwerpunkt unserer Expertise in adaptiven, geschäftskritischen Enterprise IT-Services sowie Beratungsleistungen. Bei unseren Kunden, namhafte DAX-Konzerne und im gehobenen Mittelstand, konnten wir uns einen exzellenten Ruf erarbeiten. Unser Portfolio haben wir inzwischen um den Bereich Business- und Technologieconsulting erweitert.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on de.indeed.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

6:21 min

Investigating push inefficiencies with upstream Git experts

Jonathan Creamer · Coffee With Developers

52 sec

Running persistent Linux environments directly on Windows

Ben Breard Ben Breard · World Congress 2025

1:02 min

Applying an ETL methodology to infrastructure configuration management

Axel Barbier · World Congress 2023

2:47 min

Exploring career opportunities and recruitment open positions

Kurt Eder · LIVE

56 sec

Favorite git commands and the importance of patch commits

Eileen Uchitelle Eileen Uchitelle +1 · Coffee With Developers

1:20 min

Identifying multi-disciplinary talent for developer experience engineering roles

Hazal Mestci +1 · Coffee With Developers

Videos

See all

Related articles

See all