Associate AI Inference Engineer /x)
Deutsche Telekom AG
Hamburg, Germany
1 day ago
- Discuss this with your agent
- Open in Claude
- Open in ChatGPT
Apply on www.adzuna.de
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Role details
Contract type
Internship / Graduate position
Employment type
Full-time (> 32 hours)
Experience level
Starter
Working hours
Shift work
Job source
Tech stack
Artificial Intelligence
Bash Shell
Encodings
Nvidia CUDA
Linux
Github
InfiniBand
Python (Programming Language)
Machine Learning
Remote Direct Memory Access
Prometheus
Data Logging
+13 more
Retrieval-Augmented Generation
Large Language Models
Grafana
Caching
Kubernetes
Infrastructure Automation Frameworks
Information Technology
SGLang
Triton Inference Server
TensorRT
VLLM
Terraform
Docker
Job description
- Bereitstellung, Konfiguration und Betrieb produktiver LLM-Inference-Services auf Basis der T-Systems AI Foundation Plattform.
- Optimierung von Inference-Workloads auf NVIDIA-GPU-Infrastruktur hinsichtlich Latenz, Durchsatz und GPU-Auslastung.
- Benchmarking und Evaluierung von LLM-Serving-Frameworks, Inference-Konfigurationen und Model Deployments.
- Implementierung und Optimierung moderner LLM-Serving-Techniken wie KV-Cache-Optimierung, Continuous Batching und Distributed Inference.
- Zusammenarbeit mit Plattform-Ingenieuren bei der Bereitstellung und Skalierung von AI-Workloads auf Kubernetes.
- Analyse und Behebung von Performance-Problemen im Inference-Betrieb über Software-, Netzwerk- und GPU-Infrastruktur hinweg.
- Mitwirkung bei der Automatisierung von Deployment-, Benchmarking- und Betriebsprozessen.
- Monitoring von Inference-Services mithilfe von Metriken, Logging und Dashboards zur Sicherstellung eines zuverlässigen Produktivbetriebs.
- Enge Zusammenarbeit mit AI Engineers und Researchern beim Onboarding neuer Foundation Models und Inference-Technologien.
- Pflege der technischen Dokumentation und Mitwirkung an der kontinuierlichen Weiterentwicklung der AI-Inference-Plattform., * Praktische Erfahrung mit modernen LLM-Inference-Technologien, darunter AI Foundation, vLLM, SGLang, TensorRT-LLM, NVIDIA Dynamo und LMCache.
- Arbeit mit großen GPU-Clustern für Enterprise-AI-Workloads.
- Zusammenarbeit mit erfahrenen AI Researchern, Plattform-Ingenieuren und Softwareentwicklern.
- Möglichkeiten zur kontinuierlichen Weiterbildung sowie zur fachlichen und persönlichen Weiterentwicklung.
- Ein kollaboratives Arbeitsumfeld, in dem Innovation, technische Exzellenz und Wissensaustausch gefördert
Requirements
Diese Position eignet sich insbesondere für Berufseinsteiger mit praktischer Erfahrung im Bereich LLM Inference, die mit moderner NVIDIA-GPU-Infrastruktur und produktiven KI-Systemen in großem Maßstab arbeiten möchten., * Bachelorabschluss in Informatik, Elektrotechnik, Informationstechnologie oder einer vergleichbaren technischen Fachrichtung. Ein Masterabschluss in Künstlicher Intelligenz, Machine Learning oder einem verwandten Bereich ist von Vorteil.
- Relevante praktische Erfahrung in AI Engineering, Machine Learning Engineering oder AI Infrastructure Engineering, einschließlich Erfahrung als Werkstudent oder Research Engineer.
- Sehr gute Programmierkenntnisse in Python sowie Erfahrung in der Entwicklung von AI-Anwendungen und entsprechenden Tools.
- Praktische Erfahrung bei der Bereitstellung, dem Benchmarking oder der Optimierung von Large-Language-Model-(LLM)-Inference-Workloads.
- Praktische Erfahrung mit modernen LLM-Serving-Frameworks wie vLLM und SGLang.
- Praktische Erfahrung bei der Optimierung von LLM-Inference-Workloads auf NVIDIA-GPU-Infrastruktur sowie Berührungspunkte mit NVIDIA-DGX/HGX-Systemen oder GPU-Plattformen der nächsten Generation wie B200 und B300.
- Erfahrung mit der Evaluierung oder Optimierung fortgeschrittener Inference-Techniken wie KV Caching, Disaggregated Prefill/Decode Inference oder vergleichbaren LLM-Serving-Optimierungen.
- Kenntnisse moderner NVIDIA-Inference-Technologien wie NVIDIA Dynamo, LMCache, TensorRT-LLM, Triton Inference Server oder vergleichbarer GPU-Inference-Frameworks.
- Erfahrung im Benchmarking von AI-Modellen sowie in der Analyse von Inference-Performance, Latenz, Durchsatz und Serving-Effizienz.
- Erfahrung mit Docker, Kubernetes, Bash und Linux-basierten Compute-Umgebungen.
- Ausgeprägte analytische Fähigkeiten und Problemlösungskompetenz sowie die Fähigkeit zur Zusammenarbeit in multidisziplinären Engineering-Teams.
- Reisebereitschaft von bis zu 50 %.
- Internationale Erfahrung, beispielsweise durch Studium, Arbeit oder längere Auslandsaufenthalte.
Nice-to-Have Skills
- Kenntnisse in CUDA, NCCL, NVLink, GPUDirect RDMA oder InfiniBand Networking.
- Erfahrung im Betrieb produktiver AI-Services auf Kubernetes.
- Kenntnisse von Observability-Tools wie Prometheus, Grafana und OpenTelemetry.
- Erfahrung mit Helm, Terraform, GitHub Actions oder Infrastructure-as-Code.
- Erfahrung mit Enterprise-AI-Plattformen oder Multi-Tenant-Inference-Umgebungen.
- Kenntnisse im Bereich Retrieval-Augmented Generation (RAG), Vektordatenbanken oder Embedding-Retrieval-Systemen.
Benefits & conditions
- Die Möglichkeit, an einer der größten Enterprise-AI-Plattformen Europas mitzuarbeiten.
Apply for this position
This job is hosted externally. Click below to view the full posting and apply.
Apply on www.adzuna.de
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Good distractions
Loading talks and stories from around this role…