Fullstack Backend - Fokus KI, Agenten & RAG

Heise Gruppe GmbH & Co. KG
Hannover, Germany
3 months ago

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Shift work
Job source

Tech stack

Application Programming Interfaces (APIs) Artificial Intelligence Bash Shell Databases Continuous Integration Github Python (Programming Language) PostgreSQL Routing RabbitMQ Redis Prometheus
+14 more
Data Streaming WebSocket Openapi Chatbots ReactJS Large Language Models Grafana Prompt Engineering Backend Fastapi Pytest Kubernetes Docker Microservices

Job description

  • Du baust und betreibst die Agent-Runtime unserer Plattform mit Python 3.12+ und FastAPI: Einen langlebigen, WebSocket-gebundenen Agenten nach dem ReAct-Pattern, der auf Kubernetes horizontal skaliert.
  • Du entwickelst die zentralen Bausteine der Agent-Plattform: Mode-System mit registrierten Tool-Sets, Subagent-Framework mit isoliertem Kontext und Cost-Coupling, Workflow-Registry als Langzeit-Workbook für System-, Tenant-, Team- und User-Workflows, sowie Human-in-the-Loop-Flows mit Quality-Gates für externe Aktionen und Rückfragen an Teammitglieder.
  • Der Aufbau unseres Memory-Systems gehört zu den Kernaufgaben - von Working Memory in Redis über User-Context-Profile, episodische und prozedurale Erinnerungen bis zum partitionierten Archive in PostgreSQL. Du implementierst die hybride Konsolidierungs-Pipeline mit ACT-R-basiertem Scoring und sorgst dafür, dass das System aus jeder User-Interaktion sinnvoll lernt.
  • Du baust das RAG-System, das unsere Webchatbots mit aktuellem, tenant-spezifischem Wissen versorgt, Ingestion- und Chunking-Pipeline, Vektordatenbank mit hybrider Suche und Reranking und bindest Retrieval als Tool ein, das der Agent selbst orchestriert. Über Citations und Groundedness-Metriken machst du Antwortqualität messbar besser.
  • Du integrierst und orchestrierst verschiedene LLMs (Anthropic, OpenAI, Google) über unser Gateway und setzt mehrstufige Agent-Workflows um.
  • Die Entwicklung von Echtzeit-fähigen Backends mit WebSocket-Streaming, Redis Streams für Live-Cost-Updates und Agent-State-Changes, sowie RabbitMQ für asynchrone Events gehört dazu.
  • Du realisierst sichere Code-Execution für agent-generierten Python-/JS-/Bash-Code über K8s Agent Sandbox + gVisor und designst die Capability-basierten Tool-Permissions, damit der Agent nur tun kann, was explizit erlaubt ist.
  • Du stellst Multi-Tenant-Isolation auf Datenbank-Ebene via PostgreSQL Row-Level Security sicher und überwachst LLM-Kosten, Latenz und Fehlerraten pro Tenant über strukturierte OpenTelemetry-Spans.

Requirements

  • Python 3.12+ und FastAPI in Microservice-Architekturen beherrschst du sicher, ebenso asynchrone Programmierung (asyncio, Uvicorn) inkl. langlebiger WebSockets, Backpressure und Session-Affinity über mehrere Pods.
  • LLMs in Produktion sind Pflicht: Du hast mit APIs von Anthropic, OpenAI oder Google gearbeitet, ReAct-/Tool-Calling-Loops gebaut und setzt Token-Budgets, Cost-Caps und Adaptive-Retry um.
  • Agent-Architekturen jenseits einfacher Chatbots kennst du praktisch: Memory, Tool-Orchestrierung, Subagent-Isolation, Human-in-the-Loop, ob mit LangChain/LangGraph, eigenen Frameworks oder Claude Agent SDK.
  • Mit Vektordatenbanken und ihren Indexierungs-Trade-offs bist du vertraut, beherrschst Chunking jenseits naiver Splits (semantisch, Contextual Retrieval) und hybride Suche aus dense/sparse Retrieval plus Reranking.
  • Du hast agentisches RAG gebaut, bei dem der Agent das Retrieval orchestriert: Query-Zerlegung, Multi-Hop- und Multi-Source-Retrieval, Routing und Self-Correction (Corrective/Self-RAG). Citations und messbare Retrieval-Güte (Context Precision/Recall, Faithfulness) sind Pflicht.
  • PostgreSQL (inkl. Row-Level Security), Redis (idealerweise Sentinel + AOF) und RabbitMQ sind vertraut, ebenso event-getriebene Architektur mit Idempotenz und At-least-once-Semantik.
  • Prompt Engineering und die systematische Evaluierung von LLM-Outputs gehören zum Repertoire, du machst Output-Qualität messbar.
  • KI-Tools wie Claude Code / Codex setzt du selbstverständlich und sicher in deinem eigenen Workflow ein.
  • Docker, Kubernetes und CI/CD-Pipelines mit GitHub Actions beherrschst du routiniert.
  • Observability (OpenTelemetry, W3C Trace Context, Prometheus, Grafana, Loki/Tempo) und Testing (pytest mit Async-Patterns, Contract-Tests gegen OpenAPI) runden dein Profil ab.
  • Du arbeitest Spec- und ADR-getrieben: Trade-offs schriftlich begründen, vor dem Code denken, POCs vor Architektur-Entscheidungen - für dich Hebel, nicht Bremse.

Benefits & conditions

  • Ein kleines, interdisziplinäres Team mit viel direktem Gestaltungsspielraum.
  • Ein Umfeld, das technologische Neugier und Eigenverantwortung fördert.
  • Eine hoch spannende und herausfordernde Aufgabe in einem zukunftsweisenden Markt mit enormem Wachstumspotenzial.
  • Flexible Arbeitszeiten, 100 Prozent Remote.
  • Sehr flache Hierarchien in einem Start-up mit der heise group als starkem Partner.
  • Faire Bezahlung mit Entwicklungspotenzial entlang unseres Erfolgs.
  • Profitiere von 35 Tagen Urlaub im Jahr.
  • Du arbeitest eigenverantwortlich, aber nicht allein: Ein kollegiales Team unterstützt dich bei deinen Aufgaben.
  • Alle Benefits der heise group, wie etwa günstigere Fitness-Mitgliedschaften, kostenfreier Zugang zu allen heise Produkten inkl. der Academy und vieles mehr.

Bei uns ist jede Person, unabhängig des Geschlechts, der Nationalität oder der ethnischen Herkunft, der Religion oder der Weltanschauung, einer Behinderung, des Alters sowie der sexuellen Identität willkommen.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on indeed.com

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

2:54 min

Building a minimum viable product stack for agents

Hussein Jundi Hussein Jundi +1 · World Congress 2026 Europe

3:55 min

Demonstrating semantic routing thresholds with the Redis vector library

2:07 min

Inspecting default bridge architectures and custom Docker networks

Oliver Seitz Oliver Seitz · World Congress 2025

6:36 min

Funding open source through GitHub Accelerator and Sponsors

Stormy Peters · World Congress 2023

1:22 min

Leveraging the comprehensive generative artificial intelligence stack

Duan Lightfoot Duan Lightfoot · World Congress 2024

3:42 min

Comparing in-memory and Redis storage for cache scalability

Simone Sanfratello · World Congress 2022

Videos

See all

Related articles

See all