Site Reliability Engineer - AI Healthcare Infrastructure gesucht in Karlsruhe

Mediform Gmbh
Karlsruhe, Germany
15 days ago

Role details

Contract type
Temporary contract
Employment type
Full-time (> 32 hours)
Experience level
Experienced
Experience required
3 years minimum
Compensation
€75,000.0 - €95,000.0
Working hours
Regular working hours
Languages
English, German

Tech stack

Artificial Intelligence Amazon Web Services Linux DevOps Distributed Systems Session Initiation Protocols PostgreSQL Routing Reliability Engineering Prometheus Runbook Autoscaling
+4 more
Grafana Backend Kubernetes Sentry

Job description

  • Systeme robust machen: Du sorgst fĂŒr Workload-Isolation, Redundanz, sinnvolles Autoscaling und passende Cluster-KapazitĂ€t - genug Reserven fĂŒr Lastspitzen, ohne unnötig Ressourcen laufen zu lassen. Störungen sollen gar nicht erst zu AusfĂ€llen werden.
  • Bekannte Schwachstellen durchdringen: Du untersuchst bekannte ZuverlĂ€ssigkeitsrisiken, sammelst belastbare Evidenz und bringst konkrete Handlungsoptionen mit.
  • Lösungen umsetzen: Du baust Verbesserungen selbst - als Produktionscode, Infrastructure as Code, Automatisierung, Test, Runbook oder technischen Schutzmechanismus.
  • Observability betreuen und weiterentwickeln: Du ĂŒbernimmst die Pflege unserer Alerting-Infrastruktur und verbesserst Signale, Alert-Ownership und Routing - echte Probleme erreichen sofort die richtigen Menschen, Rauschen erreicht niemanden.
  • Plattform aktuell halten: Du hĂ€ltst Kubernetes, Infrastruktur-Charts und Komponenten in einem Rhythmus aktuell, der Lifecycle-Risiken kontrolliert, ohne jedes Upgrade zur Top-PrioritĂ€t zu machen.
  • Incidents methodisch begleiten: Du arbeitest bei Störungen ruhig und methodisch mit, trennst Fakten von Annahmen und treibst die abgeleiteten Verbesserungen bis zum Abschluss. Die systemĂŒbergreifende Ursachenanalyse wĂ€chst mit deinem Systemwissen - sie ist ausdrĂŒcklich keine Erwartung ab Tag eins.
  • Gemeinsame Verantwortung stĂ€rken: Du arbeitest eng mit den Produktteams zusammen. Sie behalten die Verantwortung fĂŒr ihre Systeme; du stĂ€rkst gemeinsame Reliability-Praktiken und treibst vereinbarte Maßnahmen bis zum Abschluss.

Requirements

  • Produktionserfahrung: Typischerweise drei bis sechs Jahre Arbeit mit produktiven Systemen, etwa in DevOps, SRE, Backend oder Infrastructure Engineering. Entscheidend ist die QualitĂ€t deiner Erfahrung, nicht die exakte Jahreszahl.
  • Troubleshooting und Engineering: Du gehst auch in unbekannten verteilten Systemen methodisch vor, denkst in Failure Modes und Blast Radius und setzt Verbesserungen hands-on in Code, IaC und Automatisierung um.
  • Eigeninitiative: Du wartest nicht nur auf Tickets, sondern bemerkst Probleme, gehst ihnen nach und bringst durchdachte Optionen mit.
  • Zusammenarbeit: Du ĂŒberzeugst durch Evidenz statt Hierarchie, kannst eine andere Teamentscheidung professionell mittragen und sprichst erneut klar an, wenn neue Erkenntnisse die Lage verĂ€ndern.
  • Sicherheitsbewusstsein: Bei patientennahen Systemen behandelst du IdentitĂ€t, korrektes Routing, Mandantentrennung und Fail-closed-Verhalten als Teil der ZuverlĂ€ssigkeit - und fragst nach, bevor du eine unsichere Grenze ĂŒberschreitest.
  • Reflektierte KI-Nutzung: Du nutzt KI-Werkzeuge pragmatisch, hĂ€ltst aber Verifikation, Kontext und Verantwortung beim Menschen.
  • Sprachen: Sehr gutes Englisch. Deutsch ist hilfreich, aber fĂŒr diese interne Engineering-Rolle kein Muss.

Ein vollstĂ€ndiger Stack-Match ist nicht nötig. Entscheidend sind deine Arbeitsweise, echte Produktionserfahrung und die FĂ€higkeit, neue technische DomĂ€nen zuverlĂ€ssig zu erschließen.

Unser technischer Kontext:

Unser Umfeld umfasst AWS, Kubernetes/EKS, EC2, RDS/PostgreSQL, Prometheus, Grafana, Loki, Sentry, Linux-Netzwerke und Infrastructure as Code. Hinzu kommen SIP/RTP-basierte Telefonie, Echtzeit-Audio, GPU-Workloads, externe KI-Dienste sowie Integrationen mit Termin- und Praxisverwaltungssystemen.

Erfahrung mit einzelnen Teilen davon ist ein Plus, aber keine Voraussetzung.

Benefits & conditions

  • Eine seltene Kombination aus Cloud-Infrastruktur, Echtzeit-Audio, Telefonie und KI in einem patientennahen Produkt.
  • Eine dedizierte Rolle mit eigenem Umsetzungsraum und erfahrenen Engineers als Partner.
  • Eine klare Entwicklungsperspektive bis zur ĂŒbergreifenden Gestaltung der Reliability-Disziplin.
  • Hybrides Arbeiten mit einem modernen BĂŒro im Herzen von Karlsruhe. WĂ€hrend der Einarbeitung zwei bis drei Tage pro Woche in Karlsruhe, danach je nach Standort flexibel, bevorzugt ein bis zwei Tage pro Woche.

  • Ein persönliches Weiterentwicklungsbudget und fachliches Mentoring.

About the company

  • Level: Experienced Engineer - typischerweise drei bis sechs Jahre relevante Produktionserfahrung
  • Gehalt: 75.000-95.000 Euro brutto pro Jahr, abhĂ€ngig von Erfahrung und Verantwortungsumfang
  • Hybrid: WĂ€hrend der Einarbeitung zwei bis drei Tage pro Woche in Karlsruhe, danach je nach Standort flexibel, bevorzugt ein bis zwei Tage pro Woche

Über Mediform

Mediform ist ein Health-Tech-Startup aus Karlsruhe. Mit MediVoice entwickeln wir einen KI-basierten Telefonassistenten, der Anliegen in Arztpraxen und MVZ autonom bearbeitet - von der Terminvergabe bis zur Rezeptanfrage.

Hinter jedem Anruf steht ein verteiltes System aus Telefonie, Echtzeit-Audioverarbeitung, KI-Diensten und Schnittstellen zu Praxisverwaltungssystemen. Genau hier kommst du ins Spiel.

Warum wir diese Rolle schaffen

Bisher haben die Engineers, die unser Produkt entwickeln, auch Infrastruktur, Observability und operative Schutzmechanismen aufgebaut. Mit unserem Wachstum schaffen wir nun erstmals eine dedizierte Reliability-Rolle: fĂŒr eine Person, die Probleme eigenstĂ€ndig untersucht, fundierte Optionen erarbeitet und die gewĂ€hlte Lösung verlĂ€sslich in Produktion bringt.

Wir priorisieren Reliability-Themen gemeinsam. Du verantwortest Untersuchung, Entscheidungsgrundlage, Umsetzung und Follow-through. In den kommenden zwei bis drei Jahren kann dein Verantwortungsbereich mit wachsendem Kontext und Vertrauen bis zur ĂŒbergreifenden Gestaltung der Reliability-Disziplin bei Mediform wachsen., Wir treffen technische Entscheidungen in offener Diskussion statt ĂŒber Hierarchie. Gut begrĂŒndete Bedenken haben Gewicht, und wir Ă€ndern den Kurs, wenn die Evidenz dafĂŒr spricht.

Diese Rolle trĂ€gt echte Verantwortung, ist aber nicht der Ort, an den Produktionsprobleme oder Schuld weitergereicht werden. Bei Incidents verbessern wir Schutzmechanismen und klĂ€ren Verantwortlichkeiten - ohne SĂŒndenböcke oder Heldenkultur.

Unser Anrufvolumen beginnt gegen 07:00 Uhr und steigt ab 08:00 Uhr stark an. Ein frĂŒher Arbeitsbeginn ist praktisch, aber wir suchen keine dauerhaft verfĂŒgbare FrĂŒhschicht. Wir suchen jemanden, der mit uns sicherstellt, dass ein Ausfall um 07:00 Uhr eine entworfene und getestete Antwort hat - unabhĂ€ngig vom persönlichen Tagesrhythmus.

Wir sind AI-native: KI gehört fĂŒr uns zu Code, Untersuchung und Entscheidungsvorbereitung. Urteilsvermögen, Verifikation und Verantwortung bleiben menschlich.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.lokale-kleinanzeigen.de

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

52 sec

Running persistent Linux environments directly on Windows

Ben Breard Ben Breard · World Congress 2025

2:17 min

Mapping the maturity roadmap for scaled devops adoption

Dominik Krichbaum Dominik Krichbaum · World Congress 2026 Europe

1:22 min

Overview of the Sentry error and performance monitoring platform

Priscila Oliveira · World Congress 2023

2:47 min

Exploring career opportunities and recruitment open positions

Kurt Eder · LIVE

3:55 min

Demonstrating .NET installation on Debian and Azure Linux

Silvano Coriani Silvano Coriani · Europe 2026 Virtual

2:14 min

Exploring internal AI product initiatives and global engineering roles

Maria Apazoglou · Coffee With Developers

Videos

See all

Related articles

See all