> Markdown version of [/jobs/ext/3349270-llm-ai-platform-architect](https://www.wearedevelopers.com/jobs/ext/3349270-llm-ai-platform-architect). Every page supports `.md` or `Accept: text/markdown`. Links point to the HTML versions so they work for humans too. Agent guide: [/agents.md](https://www.wearedevelopers.com/agents.md). --- # LLM / AI Platform Architect - **Company:** SOMI Solutions GmbH - **Location:** Frankfurt am Main, Germany - **Contract:** Permanent contract - **Skills:** Artificial Intelligence, Cyber Security, Large Language Models, AI Platforms, Kubernetes - **Published:** September 10, 2026 - **Apply:** https://jobs.meinestadt.de/frankfurt-am-main/standard?id=260215412 ## About the Role * Mehrjährige Erfahrung als Architekt im Umfeld von LLM-, GenAI- oder Model-Inference-Plattformen * Nachweisbare Erfahrung mit dem produktiven Betrieb von LLM-/KI-Lösungen * Sehr gute Kenntnisse in der Architektur GPU-basierter KI-Infrastrukturen * Erfahrung mit On-Premise-Umgebungen und idealerweise Projekten im regulierten bzw. öffentlichen Umfeld * Fundierte Kenntnisse zu Betriebs- und Governance-Modellen für KI-Plattformen * Erfahrung bei der Bewertung und Auswahl leistungsfähiger Open-Weight-Modelle * Erfahrung im Umfeld dokumentenbezogener KI-Verarbeitung * Praktische Kenntnisse mit Tesseract, trOCR und ABBYY FlexiCapture * Verständnis für GPU-Ressourcenmanagement, Segmentierung und Scheduling * Kenntnisse relevanter Container-, Kubernetes- und AI-Plattform-Technologien * Verständnis für IT-Betriebsprozesse sowie Datenschutz- und Security-Anforderungen * Sehr gute Kommunikations- und Beratungskompetenz * Fähigkeit, komplexe technische Sachverhalte verständlich zu vermitteln * Sicheres Arbeiten in interdisziplinären Teams ## Description Infrastruktur Kubernetes Security Beratung KI-Plattformen Datenschutz Selbstständige Arbeitsweise, * Konzeption einer zentralen Plattform für LLM-Inference und weitere GPU-basierte KI-Workloads * Entwicklung einer geeigneten Zielarchitektur für den produktiven On-Premise-Betrieb * Planung und Bewertung von LLM-Serving- und Inference-Komponenten * Definition von Betriebs-, Governance- und Bereitstellungsmodellen für die KI-Plattform * Beratung bei der Auswahl geeigneter Open-Weight-Modelle, insbesondere für deutschsprachige Anwendungsfälle * Bewertung von Anforderungen an GPU-Kapazitäten, deren Aufteilung und Nutzung * Konzeption geeigneter Verfahren zur GPU-Segmentierung und Ressourcensteuerung * Berücksichtigung von NVIDIA MIG sowie alternativen GPU-Sharing- und Scheduling-Ansätzen * Begleitung der Integration der Plattform in bestehende Infrastruktur- und Betriebslandschaften * Vorbereitung der technischen Anbindung bestehender dokumentenbasierter KI-Anwendungen * Berücksichtigung von Datenschutz, Informationssicherheit, Datensouveränität und regulatorischen Anforderungen * Abstimmung mit beteiligten Architektur-, Plattform- und Betriebsteams * Erstellung technischer Konzepte, Entscheidungsgrundlagen und Betriebsdokumentationen ## Related Videos - [Understanding Kubernetes in a visual way](https://www.wearedevelopers.com/videos/100085-understanding-kubernetes-in-a-visual-way) - [This App Reached 10,000 Users in One Week. Here's How.](https://www.wearedevelopers.com/videos/100329-this-app-reached-10-000-users-in-one-week-here-s-how) - [Thinking Differently - How to Make Money from Cyber Attacks & Cheats](https://www.wearedevelopers.com/videos/745-thinking-differently-how-to-make-money-from-cyber-attacks-cheats) - [LLMOps-driven fine-tuning, evaluation, and inference with NVIDIA NIM & NeMo Microservices](https://www.wearedevelopers.com/videos/1582-llmops-driven-fine-tuning-evaluation-and-inference-with-nvidia-nim-nemo-microservices) - [From AI Assistance to Agentic Systems: Scaling Sovereign AI in Banking](https://www.wearedevelopers.com/videos/100070-from-ai-assistance-to-agentic-systems-scaling-sovereign-ai-in-banking) - [Instant KAI Sandboxes with vCluster: Multi-Tenant, Multi-Scheduler GPU Sharing](https://www.wearedevelopers.com/videos/100333-instant-kai-sandboxes-with-vcluster-multi-tenant-multi-scheduler-gpu-sharing) ## Related Articles - [MLOps – What’s the deal behind it?](https://www.wearedevelopers.com/magazine/125-mlops-what-s-the-deal-behind-it) - [Stephan Gillich - Bringing AI Everywhere](https://www.wearedevelopers.com/magazine/489-stephan-gillich-bringing-ai-everywhere) - [MLOps And AI Driven Development](https://www.wearedevelopers.com/magazine/82-mlops-and-ai-driven-development) - [The Biggest German Tech Companies](https://www.wearedevelopers.com/magazine/424-the-biggest-german-tech-companies) - [Best Coding Boot Camps in Germany](https://www.wearedevelopers.com/magazine/237-best-coding-boot-camps-in-germany) - [Coffee with Developers - Maria Apazoglou - Making AI understandable for all in production](https://www.wearedevelopers.com/magazine/475-coffee-with-developers-maria-apazoglou-making-ai-understandable-for-all-in-production)