> Markdown version of [/jobs/ext/3613039-associate-ai-inference-engineer-x](https://www.wearedevelopers.com/jobs/ext/3613039-associate-ai-inference-engineer-x). Every page supports `.md` or `Accept: text/markdown`. Links point to the HTML versions so they work for humans too. Agent guide: [/agents.md](https://www.wearedevelopers.com/agents.md). --- # Associate AI Inference Engineer /x) - **Company:** Deutsche Telekom AG - **Location:** Hamburg, Germany - **Experience:** Starter - **Contract:** Internship / Graduate position - **Skills:** Artificial Intelligence, Bash Shell, Encodings, Nvidia CUDA, Linux, Github, InfiniBand, Python (Programming Language), Machine Learning, Remote Direct Memory Access, Prometheus, Data Logging, Retrieval-Augmented Generation, Large Language Models, Grafana, Caching, Kubernetes, Infrastructure Automation Frameworks, Information Technology, SGLang, Triton Inference Server, TensorRT, VLLM, Terraform, Docker - **Published:** October 8, 2026 - **Apply:** https://www.adzuna.de/details/5914284720 ## About the Role Diese Position eignet sich insbesondere für Berufseinsteiger mit praktischer Erfahrung im Bereich LLM Inference, die mit moderner NVIDIA-GPU-Infrastruktur und produktiven KI-Systemen in großem Maßstab arbeiten möchten., * Bachelorabschluss in Informatik, Elektrotechnik, Informationstechnologie oder einer vergleichbaren technischen Fachrichtung. Ein Masterabschluss in Künstlicher Intelligenz, Machine Learning oder einem verwandten Bereich ist von Vorteil. * Relevante praktische Erfahrung in AI Engineering, Machine Learning Engineering oder AI Infrastructure Engineering, einschließlich Erfahrung als Werkstudent oder Research Engineer. * Sehr gute Programmierkenntnisse in Python sowie Erfahrung in der Entwicklung von AI-Anwendungen und entsprechenden Tools. * Praktische Erfahrung bei der Bereitstellung, dem Benchmarking oder der Optimierung von Large-Language-Model-(LLM)-Inference-Workloads. * Praktische Erfahrung mit modernen LLM-Serving-Frameworks wie vLLM und SGLang. * Praktische Erfahrung bei der Optimierung von LLM-Inference-Workloads auf NVIDIA-GPU-Infrastruktur sowie Berührungspunkte mit NVIDIA-DGX/HGX-Systemen oder GPU-Plattformen der nächsten Generation wie B200 und B300. * Erfahrung mit der Evaluierung oder Optimierung fortgeschrittener Inference-Techniken wie KV Caching, Disaggregated Prefill/Decode Inference oder vergleichbaren LLM-Serving-Optimierungen. * Kenntnisse moderner NVIDIA-Inference-Technologien wie NVIDIA Dynamo, LMCache, TensorRT-LLM, Triton Inference Server oder vergleichbarer GPU-Inference-Frameworks. * Erfahrung im Benchmarking von AI-Modellen sowie in der Analyse von Inference-Performance, Latenz, Durchsatz und Serving-Effizienz. * Erfahrung mit Docker, Kubernetes, Bash und Linux-basierten Compute-Umgebungen. * Ausgeprägte analytische Fähigkeiten und Problemlösungskompetenz sowie die Fähigkeit zur Zusammenarbeit in multidisziplinären Engineering-Teams. * Reisebereitschaft von bis zu 50 %. * Internationale Erfahrung, beispielsweise durch Studium, Arbeit oder längere Auslandsaufenthalte. Nice-to-Have Skills * Kenntnisse in CUDA, NCCL, NVLink, GPUDirect RDMA oder InfiniBand Networking. * Erfahrung im Betrieb produktiver AI-Services auf Kubernetes. * Kenntnisse von Observability-Tools wie Prometheus, Grafana und OpenTelemetry. * Erfahrung mit Helm, Terraform, GitHub Actions oder Infrastructure-as-Code. * Erfahrung mit Enterprise-AI-Plattformen oder Multi-Tenant-Inference-Umgebungen. * Kenntnisse im Bereich Retrieval-Augmented Generation (RAG), Vektordatenbanken oder Embedding-Retrieval-Systemen. ## Description * Bereitstellung, Konfiguration und Betrieb produktiver LLM-Inference-Services auf Basis der T-Systems AI Foundation Plattform. * Optimierung von Inference-Workloads auf NVIDIA-GPU-Infrastruktur hinsichtlich Latenz, Durchsatz und GPU-Auslastung. * Benchmarking und Evaluierung von LLM-Serving-Frameworks, Inference-Konfigurationen und Model Deployments. * Implementierung und Optimierung moderner LLM-Serving-Techniken wie KV-Cache-Optimierung, Continuous Batching und Distributed Inference. * Zusammenarbeit mit Plattform-Ingenieuren bei der Bereitstellung und Skalierung von AI-Workloads auf Kubernetes. * Analyse und Behebung von Performance-Problemen im Inference-Betrieb über Software-, Netzwerk- und GPU-Infrastruktur hinweg. * Mitwirkung bei der Automatisierung von Deployment-, Benchmarking- und Betriebsprozessen. * Monitoring von Inference-Services mithilfe von Metriken, Logging und Dashboards zur Sicherstellung eines zuverlässigen Produktivbetriebs. * Enge Zusammenarbeit mit AI Engineers und Researchern beim Onboarding neuer Foundation Models und Inference-Technologien. * Pflege der technischen Dokumentation und Mitwirkung an der kontinuierlichen Weiterentwicklung der AI-Inference-Plattform., * Praktische Erfahrung mit modernen LLM-Inference-Technologien, darunter AI Foundation, vLLM, SGLang, TensorRT-LLM, NVIDIA Dynamo und LMCache. * Arbeit mit großen GPU-Clustern für Enterprise-AI-Workloads. * Zusammenarbeit mit erfahrenen AI Researchern, Plattform-Ingenieuren und Softwareentwicklern. * Möglichkeiten zur kontinuierlichen Weiterbildung sowie zur fachlichen und persönlichen Weiterentwicklung. * Ein kollaboratives Arbeitsumfeld, in dem Innovation, technische Exzellenz und Wissensaustausch gefördert