(Senior) AI Platform Engineer
Evoila Gmbh
Mainz, Germany
1 day ago
- Discuss this with your agent
- Open in Claude
- Open in ChatGPT
Apply on www.adzuna.de
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Role details
Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience level
Expert
Experience required
3 years minimum
Working hours
Shift work
Languages
English, German
Job source
Tech stack
Java (Programming Language)
Artificial Intelligence
Amazon Web Services
Microsoft Azure
Cloud Computing
Encodings
Continuous Integration
Data Security
Python (Programming Language)
Octopus Deploy
Performance Tuning
Role-Based Access Control
+17 more
Regression Testing
OpenAI
Ansible
Azure Machine Learning
Data Streaming
Load Balancing
Retrieval-Augmented Generation
Large Language Models
Agentic-AI
Kubernetes
Infrastructure Automation Frameworks
Machine Learning Operations
Nim (Programming Language)
Artificial Intelligence Governance
Terraform
KServe
Golang
Job description
- Planung, Aufbau und Betrieb von hochverfügbaren AI/ML-Plattformen und -Services, insbesondere auf Basis von Kubernetes in On-Premises-, Hybrid- und Cloud-Umgebungen.
- Design und Umsetzung skalierbarer GPU-Infrastrukturen innerhalb von Kubernetes-Clustern - inklusive GPU-Scheduling und -Sharing (z. B. Kueue, KAI-Scheduler, Run:ai, NVIDIA MIG/Time-Slicing) mit Blick auf Auslastung und Kosteneffizienz.
- Aufbau und Betrieb von Model-Serving- und Inferenz-Diensten (z. B. vLLM, NVIDIA Triton, KServe, NVIDIA NIM, Ray) für klassische ML-Modelle und Large Language Models.
- Entwicklung und Betrieb von MLOps-/LLMOps-Workflows für produktive GenAI-Services - inklusive Guardrails & Policies, Evaluierung, Regressionstests sowie Kosten- und Qualitätsmonitoring.
- Bereitstellung von Fine-Tuning- und Re-Training-Workflows (z. B. LoRA, kontinuierliches Re-Training) auf der Plattform.
- Monitoring, Troubleshooting und Performance-Tuning von AI-Plattformen (u. a. GPU-Auslastung, Inferenz-Latenz, Durchsatz), um höchste Performance und Verfügbarkeit sicherzustellen.
- Beratung unserer Kunden in Bezug auf Best Practices, AI-Governance, Datensicherheit und Datenschutz im Kontext von AI-Plattformen auf Kubernetes.
- Enge Zusammenarbeit mit Data-Science-, Data-Platform- und Entwicklungsteams zur Sicherstellung der nahtlosen Integration von AI-Lösungen.
Requirements
- Mindestens 3 Jahre Erfahrung im Betrieb und der Optimierung von Plattformen und Services at Scale in Kubernetes-Umgebungen, egal ob On-Premise oder in der Cloud.
- Fundierte Kenntnisse in der Architektur und dem Betrieb von skalierbaren Lösungen unter Verwendung von Kubernetes, idealerweise inklusive GPU-Workloads.
- Programmierkenntnisse in Python, idealerweise ergänzt um Golang oder Java.
- Erfahrung mit mindestens einem Model-Serving-Framework (z. B. vLLM, NVIDIA Triton, KServe) sowie erste oder vertiefte Erfahrung mit MLOps-Werkzeugen (z. B. MLflow, Kubeflow, ClearML).
- Erfahrung mit Infrastructure-as-Code-Tools wie Ansible und Terraform sowie CI/CD- und GitOps-Werkzeugen (z. B. Argo CD, Flux).
- Sehr gute Kommunikationsfähigkeiten in Deutsch und Englisch. Idealerweise hast du bereits Kunden beraten und kannst technische Themen zielgruppengerecht vermitteln - vom Engineering-Team bis zum Management., * Mindestens 5 Jahre einschlägige Erfahrung im Plattform-Engineering.
- Architektur-Ownership: Du verantwortest das Design von AI-Plattformen end-to-end und triffst technologische Grundsatzentscheidungen.
- Technische Führung in Kundenprojekten (Lead-Rolle) sowie Mentoring von Kolleginnen und Kollegen.
Darüber hinaus verfügst du idealerweise über:
- Erfahrung mit Cloud-AI-Diensten (z. B. AWS SageMaker/Bedrock, Azure ML/Azure OpenAI/Azure AI Foundry) und deren Integration mit Kubernetes-Workloads.
- Kenntnisse im Betrieb von LLM-basierten Architekturen, z. B. RAG-Pipelines, Vektordatenbanken und Embedding-Services sowie Agentic-AI-Ansätze und Model Context Protocol (MCP).
- Verständnis von System-Level-Grundlagen des LLM-Servings (Rate Limiting, Token Streaming, Load Balancing) und LLM-Konzepten wie Reasoning, Tool Calling und Prompt Templates.
- Erfahrung mit neuen Serving-Bausteinen wie llm-d oder Kubernetes Inference Gateway.
- Kenntnisse in der Absicherung von AI-Plattformen, z. B. TLS, RBAC und Network Policies innerhalb von Kubernetes-Umgebungen, sowie Grundverständnis von AI-Governance (z. B. EU AI Act).
- Zertifizierungen im Bereich relevanter Technologien (z. B. Certified Kubernetes Administrator/Developer, NVIDIA-Zertifizierungen).
- Bereitschaft zu gelegentlichen Reisen im DACH-Raum.
Benefits & conditions
- Betriebliche Altersvorsorge
- Teamorientierte Unternehmenskultur mit regelmäßigen Teamevents
- Gezielte Förderung deiner fachlichen Weiterentwicklung
- Corporate Benefits Programm
- Flexible Arbeitszeiten
- Moderner Arbeitsplatz mit zeitgemäßer Ausstattung
- Remote-Work-Möglichkeiten
Apply for this position
This job is hosted externally. Click below to view the full posting and apply.
Apply on www.adzuna.de
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Good distractions
Talks and stories from around this role — technically off-topic, practically not.
Moments
Explore playlistsVideos
See allRelated articles
See all
LM
Luis Minvielle
almost 3 years ago
BB
Benedikt Bischof
MLOps – What’s the deal behind it?
almost 4 years ago
LM
Luis Minvielle
The Biggest German Tech Companies
over 2 years ago
LM
Luis Minvielle
The Most Popular IT Jobs on the Market
over 2 years ago
KD
Krissy Davis
Best Coding Boot Camps in Germany
over 3 years ago
BB
Benedikt Bischof
MLOps And AI Driven Development
over 4 years ago