Site Reliability Engineer (SRE)

Deutsche Telekom AG
Darmstadt, Germany
yesterday

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Shift work
Languages
German

Job location

Darmstadt, Germany

Tech stack

Cloud Computing
Cloud Engineering
Computer Security
Distributed Systems
Python
Open Source Technology
Reliability Engineering
Security Information and Event Management
Software Systems
Syslog
Kubernetes

Job description

Bei T-Systems bieten wir unseren Geschäftskunden die richtigen Systemlösungen für ihr digitales Business. Mit unserem Portfolio stellen wir sicher, dass digitale Transformation Komplexität reduziert, Kosten einspart und die alltägliche Arbeit erleichtert. Unsere Schwerpunkte sind Konnektivität, Digital, Cloud & Infrastruktur sowie Sicherheit - Let's power higher performance! Über die Position Als Site Reliability Engineer mit Schwerpunkt Observability tragen Sie maßgeblich dazu bei, Transparenz, Stabilität und Zuverlässigkeit unserer verteilten Cloud-, Edge- und Kubernetes-Plattformen sicherzustellen. Sie übernehmen eine zentrale Rolle bei der Konzeption, Implementierung und kontinuierlichen Weiterentwicklung moderner Observability-Lösungen und schaffen die Grundlage für einen zuverlässigen Betrieb komplexer, cloud-nativer Infrastrukturen.Mit Ihrer Expertise in OpenTelemetry, Distributed Tracing und modernen Telemetrie-Architekturen entwickeln und betreiben Sie leistungsfähige Pipelines für Metrics, Logs und Traces. Dabei integrieren Sie den OpenTelemetry Collector, OTLP sowie SDKs und Auto-Instrumentation in bestehende Plattformen und schaffen eine durchgängige End-to-End-Observability über verteilte Anwendungen und Services hinweg.Sie implementieren und betreiben Jaeger als zentrale Plattform für Distributed Tracing und entwickeln Korrelationsmechanismen zwischen Logs, Metrics und Traces, um Fehlerursachen schnell zu identifizieren und komplexe Abhängigkeiten innerhalb verteilter Systeme transparent darzustellen. Dabei berücksichtigen Sie moderne Sampling-Strategien, Context Propagation sowie effiziente Konzepte für Trace Storage und die performante Auswertung großer Telemetriedatenmengen.Darüber hinaus integrieren Sie Security-, Infrastruktur- und Plattform-Events in zentrale SIEM-Lösungen und entwickeln standardisierte Telemetrie- und Instrumentierungskonzepte für Kubernetes- und Cloud-Native-Plattformen. Mit Ihren Programmierkenntnissen in Go, Python oder Shell automatisieren Sie Integrations- und Betriebsprozesse und leisten einen wesentlichen Beitrag zur Weiterentwicklung einer skalierbaren, hochverfügbaren und zukunftssicheren Observability-Plattform für moderne verteilte Infrastrukturen. Must-Have Skills, Implementierung, Konfiguration und Betrieb von OpenTelemetry für Metrics-, Logs- und Distributed-Tracing-Pipelines

  • Integration, Administration und kontinuierliche Optimierung von Jaeger zur Visualisierung und Analyse verteilter Services und Anwendungen
  • Konzeption und Umsetzung von Korrelationsmechanismen zwischen Logs, Metrics und Traces zur Schaffung einer durchgängigen End-to-End-Observability
  • Integration von Security-, Infrastruktur- und Plattform-Events in zentrale SIEM- und Analyseplattformen zur Unterstützung von Monitoring- und Security-Prozessen
  • Entwicklung und Etablierung von Telemetrie-, Instrumentierungs- und Observability-Standards für Cloud-Native- und Kubernetes-Plattformen
  • Sicherstellung eines zuverlässigen und performanten Betriebs von Observability-Lösungen in Air-Gap-, Edge-, Fog- und verteilten Infrastrukturen, Sie erwartet eine anspruchsvolle Aufgabe im Umfeld moderner Cloud-Native-, Kubernetes-, Edge- und Observability-Technologien. In dieser Position gestalten Sie den Aufbau einer zukunftsfähigen Observability-Plattform aktiv mit und arbeiten an innovativen Lösungen für Telemetrie, Distributed Tracing und Security Monitoring in verteilten Infrastrukturen. Dabei kommen aktuelle Open-Source-Technologien wie OpenTelemetry, Jaeger und moderne Cloud-Native-Werkzeuge zum Einsatz, um Transparenz und Zuverlässigkeit komplexer Plattformen kontinuierlich zu verbessern. Sie arbeiten in einem technologisch anspruchsvollen Umfeld mit einem hohen Maß an Gestaltungsspielraum und leisten einen wesentlichen Beitrag zur Stabilität, Sicherheit und Skalierbarkeit geschäftskritischer Systeme.

Requirements

Sehr gute Kenntnisse in OpenTelemetry, insbesondere im Umgang mit dem OpenTelemetry Collector, OTLP, SDKs sowie Auto-Instrumentation

  • Fundierte Erfahrung mit Distributed Tracing, einschließlich Span Correlation, Context Propagation und Sampling-Strategien
  • Erfahrung im Aufbau und Betrieb von Jaeger, insbesondere hinsichtlich Trace Storage, Indexierung und Query-Optimierung
  • Fundierte Kenntnisse in der Integration von SIEM-Lösungen, im Security Event Management sowie im Einsatz von CEF- und Syslog-basierten Protokollen
  • Gute Programmierkenntnisse in Go, Python oder Shell zur Umsetzung von Telemetrie-, Integrations- und Automatisierungsaufgaben
  • Erfahrung im Bereich Kubernetes Observability, Cloud-Native-Plattformen sowie moderner Telemetrie-Architekturen
  • Ausgeprägtes Verständnis für IT-Sicherheit und Security Awareness
  • Analytische und strukturierte Arbeitsweise
  • Erfahrung im Site Reliability Engineering oder Infrastruktur-Betrieb
  • Sehr gutes Deutsch in Wort und Schrift (C1-Niveau)

Benefits & conditions

Flexibilität und Work-Life-Balance: Profitieren Sie von flexiblen Arbeitszeiten, der Möglichkeit zum mobilen Arbeiten und einem hybriden Arbeitsmodell.Attraktive Vergütung: Ein wettbewerbsfähiges Gehaltspaket, das Ihre Expertise und Leistung honoriert.Entwicklungsmöglichkeiten: Zugang zu umfangreichen Weiterbildungsangeboten, Schulungen und Karriereentwicklungsprogrammen.Modernes Arbeitsumfeld: Arbeiten Sie in einer modernen Ausstattung mit den neuesten Technologien und Tools.Starke Unternehmenskultur: Eine offene und kollegiale Arbeitsatmosphäre, in der Teamarbeit und gegenseitige Unterstützung großgeschrieben werden.Gesundheit und Wohlbefinden: Angebote zur Gesundheitsförderung und Initiativen, die Ihr Wohlbefinden unterstützen.Zusatzleistungen: Diverse Benefits wie betriebliche Altersvorsorge, Mitarbeiterrabatte und Jobticket-Optionen.

About the company

Die Deutsche Telekom ist Europas größtes Telekommunikationsunternehmen und weltweit in mehr als 50 Ländern vertreten. Mit rund 207.000 Mitarbeitenden erwirtschaftete sie im Geschäftsjahr 2022 einen Umsatz von 114,4 Milliarden Euro. 

Wir entwickeln Technologie und Innovationen für Menschen, Umwelt und Unternehmen, um damit gemeinsame Herausforderungen zu bewältigen.

Sei dabei und gestalte mit uns die Zukunft, mache den Alltag einfacher und sicherer mit KI, entwickle Lösungen für das Internet der Dinge oder digitalisiere Prozesse mit uns als Marktführer im Bereich Cloud Computing. 

Bei der Telekom teilen wir mehr als den Arbeitgeber. Wir teilen die gleichen Werte und setzen uns für diese ein. Unser Ziel ist es, den stetigen Wandel zu treiben und ihn zu nutzen, um die Welt zu einem inklusiveren und lebenswerteren Ort zu machen. Nur indem wir den Status quo hinterfragen, können wir ein besseres Morgen erschaffen. Jede und jeder von uns kann ein Katalysator für Veränderung und dieser Funke der Inspiration sein, der Fortschritt ermöglicht. Ob du Einsteiger*in bist oder bereits begonnen hast, bevor es Computer Displays gab: Wenn du den Willen hast, Dinge zu verändern, mit uns gemeinsam auf die Reise gehen und in einem globalen Netzwerk wachsen willst, bist du hier richtig!

 #QuestionTodayCreateTomorrow


Werde Teil von uns: www.telekom.com/de/karriere/question-today-create-tomorrow 




Apply for this position