DevOps Engineer - AWS, OpenShift, Service Management, KI/ GenAI/agentische Anwendungen - remote
Westhouse Consulting GmbH
Berlin, Germany
3 days ago
Role details
Contract type
Permanent contract Employment type
Full-time (> 32 hours) Working hours
Regular working hours Languages
German Experience level
JuniorJob location
Berlin, Germany
Tech stack
Artificial Intelligence
Amazon Web Services (AWS)
Cloud Computing
Continuous Integration
Identity and Access Management
Openshift
Azure
Data Logging
Multi-Agent Systems
Kubernetes
Job description
- Betrieb und Weiterentwicklung eines KI-basierten Chat- und Assistenzsystems einschließlich GenAI- und Agenten-Komponenten im produktiven Umfeld.
- Aufbau, Konfiguration und Betrieb von CI/CD-Pipelines, Deployment-Prozessen sowie automatisierten Betriebsabläufen für KI- und Cloud-Anwendungen.
- Betrieb, Absicherung und Optimierung containerisierter Laufzeitumgebungen auf Basis von Kubernetes und vergleichbaren Cloud-nativen Plattformen.
- Implementierung, Integration und Betrieb von MCP-Servern sowie MCP-basierten Anbindungen für Agenten- und Tool-Integrationen.
- Durchführung von Maßnahmen zur Sicherstellung von Verfügbarkeit, Skalierbarkeit, Stabilität und Performance produktiver Systeme.
- Umsetzung und Weiterentwicklung von Logging-, Monitoring-, Alerting- und Observability-Konzepten für Anwendungen und Plattformkomponenten.
- Konzeption und Umsetzung von IAM-, Secret-Management- und Security-Anforderungen in Cloud- und KI-Umgebungen.
- Durchführung von Incident-, Problem- und Root-Cause-Analysen einschließlich Ableitung und Umsetzung nachhaltiger Verbesserungsmaßnahmen.
- Aufbau und Weiterentwicklung produktionsreifer Betriebsmodelle, Runbooks, Dokumentationen sowie Support- und Eskalationsprozesse.
- Umsetzung von Governance-, Compliance- und Sicherheitsanforderungen für KI-Systeme, einschließlich Auditierbarkeit, Nachvollziehbarkeit von Entscheidungen, Policy Enforcement und technischer Schutzmaßnahmen.
- Durchführung der Integration und Operationalisierung von GenAI-Services und Agentic-Engineering-Werkzeugen (z. B. AWS Bedrock, Azure AI Services, AWS Kiro oder vergleichbare Plattformen) im Rahmen produktiver Betriebsprozesse.
- Erstellung technischer Dokumentationen, Betriebsdokumentationen und Architekturartefakte für die entwickelten und betriebenen Lösungen.
Requirements
- 5 Jahre Erfahrung im Betrieb produktiver Plattform- und Cloud-Umgebungen: Mehrjährige Erfahrung im DevOps-, Platform- oder Cloud-Engineering mit Betriebsverantwortung für produktive Systeme
- 3 Jahre Erfahrung im Aufbau und Betrieb von CI/CD-Pipelines sowie automatisierten Deployment-Prozessen
- 1 Jahr Erfahrung im Betrieb und der Weiterentwicklung von KI-, GenAI- oder agentischen Anwendungen
- 3 Jahre Erfahrung im Operations-Umfeld von Cloud- und Container-Plattformen für den Übergang von OpenShift zu AWS in den letzten 4 Jahren
- 3 Jahre Erfahrung im IT-Betrieb und Service Management produktiver Systeme: Erfahrung im Incident Management, Problem Management und produktiven Systembetrieb
- SOLL-Kriterien:
- Erfahrung aus 2 Projekten im Agentic Engineering, insbesondere Agent-Orchestrierung, Tool-Nutzung, Multi-Agent-Architekturen und Agent-Lifecycle-Management
- Erfahrung aus 2 Projekten im Aufbau produktionsreifer Betriebsmodelle, Runbooks, Supportstrukturen, Bereitschafts- und Eskalationsprozesse
- Erfahrung aus 2 Projeken in Skalierung, Hochverfügbarkeit, Resilienz und Performanceoptimierung produktiver cloud-nativer Plattformen
- Erfahrung aus 1 Projekt in der Einführung neuer Technologien, Engineering-Werkzeuge oder Betriebsprozesse im KI-/GenAI-/Agentic-Umfeld
- Erfahrung aus 1 Projekt in der Erstellung technischer Betriebs-, Architektur- und Entscheidungsdokumentationen für produktive Plattformen und KI-Systeme
- Erfahrung aus 2 Projekten in der Zusammenarbeit mit Architektur-, Plattform-, Security-, Entwicklungs- und Betriebsteams in komplexen Organisationen
- Erfahrung aus 1 Projekt mit GenAI-Plattformen und KI-Foundation-Services (z. B. AWS Bedrock, Azure AI Services oder vergleichbare Plattformen)
- Erfahrung aus 2 Projekten mit IAM-, Security- und Secret-Management-Konzepten in komplexen Cloud-Umgebungen über die Mindestanforderungen hinaus
- Erfahrung aus 2 Projekten mit MCP-basierten Integrationsszenarien, insbesondere produktive MCP-Server, Tool-Gateways, Registries oder Tool-Integrationen
- Security und Compliance für KI-Lösungen: Erfahrung aus 1 Projekt in der Umsetzung von Governance-, Security- und Compliance-Anforderungen für KI-Lösungen (Guardrails, Auditierbarkeit, Policy Enforcement, Nachvollziehbarkeit von Entscheidungen)