Lead Engineer - SRE - Cloud Storage - STACKIT

Schwarz Unternehmenskommunikation GmbH & Co. KG
Heilbronn, Germany
23 days ago

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience level
Expert
Working hours
Regular working hours
Languages
English, German
Job source

Tech stack

Application Programming Interfaces (APIs) Bash Shell Cloud Computing Cloud Storage Elasticsearch Monitoring of Systems Python (Programming Language) NetApp Applications Ansible Prometheus Ceph (Software) Data Logging
+4 more
Grafana Kubernetes Restful APIs Golang

Requirements

  • Du hast ausgeprägte Erfahrung im Marktumfeld mit verschiedenen Storageprodukten (z.B. NetApp, Cohesity, Pure, Ceph) im Bereich Block-, Objekt-, Backup- oder File Storage und verfügst über gute Kenntnisse mit Cloud Umgebungen und deren Architekturen
  • Du bist Experte im Betrieb von Storageinfrastruktur (z.B. Lösungsszenarien, Bereitstellung, Skalierung, Migration, Incident response) und deren Automatisierung (z.B. mittels Golang/Python, Bash, Ansible)
  • Du kennst Dich gut in containerisierten Systemlandschaften des Storageumfelds aus (z.B. k8s)
  • Du hast Erfahrung im Monitoring, Alerting und Logging zur Sicherstellung einer lückenlosen Systemüberwachung (z.B. Prometheus, Grafana, Elasticsearch)
  • Du arbeitest bereits mit APIs und entwickelst diese weiter (z.B. REST API mit Golang und Python)
  • Du hast Spaß an den Herausforderungen beim Betrieb von Storage-Systemen (z.B. Protokolle, Troubleshooting, Performanceanalysen, Hochverfügbarkeit, Lifecycle)
  • Du bringst Leidenschaft und Begeisterung für neue Technologien und Themen rund um verschiedene Speichersysteme mit
  • Du bist gerne Teil eines motivierten Teams, das immer nach Verbesserungen strebt und sich selbst (und die Produkte) kontinuierlich weiterentwickelt
  • Deine ausgezeichnete Kommunikationsfähigkeit in Deutsch und Englisch bildet die Basis für eine erfolgreiche Zusammenarbeit in internationalen, agilen Teams

About the company

Schwarz Digits schafft das technologische Fundament für digitale Entscheidungsfreiheit in Europa. Als IT- und Digitalsparte der Schwarz Gruppe entwickeln und verantworten wir einerseits die IT-Infrastrukturen für die Handelssparten Lidl und Kaufland sowie die Schwarz Produktion und PreZero. Gleichzeitig agieren wir als unabhängiger Anbieter am externen Markt, um Unternehmen in ganz Europa bei ihrer digitalen Transformation zu unterstützen. Unsere Kernleistungen bündeln wir in den Bereichen Cloud, Cyber Security, Data & AI, Communication und Workspace. Trage auch du zur digitalen Entscheidungsfreiheit in Europa bei.

Bei uns arbeitest du an der Schnittstelle zwischen Agilität und Sicherheit: Du profitierst von den schnellen Entscheidungswegen, genießt echte Gestaltungsspielräume in deinen Projekten und baust dabei auf das stabile Fundament der Schwarz Gruppe.Deine Aufgaben

  • Stabilität & Reliability: Du bist verantwortlich für die Aufrechterhaltung und Optimierung der Stabilität und Verfügbarkeit unserer hochverfügbaren, resilienten Storageinfrastruktur (Block-, Objekt-, Backup- und File-Storage). Dies stellst Du durch proaktives Monitoring sicher, löst aufkommende Störungen eigenverantwortlich und vermeidest deren zukünftiges Auftreten
  • Automatisierung: Du automatisierst die Bereitstellungs- und Betriebsprozesse im Storage Umfeld mit dem eigenen Anspruch, jeden Tag ein bisschen besser zu werden und unsere Produkte kontinuierlich zu optimieren
  • Architektur: Mit Deinem Team verantwortest Du eine robuste und effiziente Storagearchitektur - weil es Dir wichtig ist, eine langfristig stabile und zuverlässige Lösung zu bauen, die unsere Kunden gerne einsetzen
  • Ende-zu-Ende-Verantwortung: Die Identifikation mit unseren Produkten, die wir unseren Kunden bereitstellen, ist uns sehr wichtig. Daher leben wir aktiv eine Ende-zu-Ende-Verantwortung und bekommen hierbei Unterstützung aus vielen internen STACKIT Service Teams zur Veredelung unserer Services
  • Performance- und Kapazitätsplanung: Du analysierst und optimierst die Performance unserer Bestandssysteme im Hinblick auf zukünftige Skalierung der Landschaft. Dies beinhaltet auch eine vorausschauende Kapazitätsplanung
  • Incident- und Postmortem-Analyse: Dir obliegt die Aufarbeitung von (Major) Incidents mit Storage-Beteiligung im Rahmen des Incident & Problem Management Prozesses der STACKIT mit dem Ziel, mitigierende Maßnahmen für die Zukunft abzuleiten und anschließend erfolgreich umzusetzen

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.adzuna.de

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

1:08 min

Building solutions with open source GoLang infrastructure tools

Jad Wahab · LIVE

1:42 min

Automating Skupper deployments using Ansible

Alex Soto Alex Soto · WWC 2024

10:40 min

Visualizing Prometheus open metrics using custom Grafana dashboards

Stijn Polfliet · LIVE

2:47 min

Exploring career opportunities and recruitment open positions

Kurt Eder · LIVE

1:33 min

Case study on adopting Kubernetes and Golang effectively

Andrew Holway · LIVE

4:36 min

Hiring passionate software engineers to tackle unprecedented scaling challenges

Dana Lawson Dana Lawson +1 · WWC Europe 2026

Videos

See all

Related articles

See all