Tech Lead Expert Data Retrieval Rag H/F

Soft Skillsvision Produit
France
3 days ago
Apply on www.hellowork.com
Prepare application

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience level
Expert
Working hours
Regular working hours
Languages
English

Tech stack

Clean Code Principles Java (Programming Language) Artificial Intelligence Airflow Automation of Tests Continuous Integration Data Security Information Retrieval Python (Programming Language) Open Source Technology Parsing Redis
+7 more
Management of Software Versions Planning Software Large Language Models Apache Spark Apache Kafka Search Engines Docker

Job description

Votre mission n’est pas d’écrire un simple script : c’est de concevoir des pipelines de données robustes, capables d’ingérer, nettoyer et indexer d’énormes corpus juridiques, puis d’exposer une recherche rapide, pertinente et hybride (sémantique + lexicale) à grande échelle.

Vos missions au quotidien

  1. Collecte, ingestion & indexation
  • Concevoir des pipelines d’ingestion sur des sources hétérogènes (édition, open data, bases juridiques) : parsing, nettoyage, chunking, normalisation.
  • Choisir et industrialiser les modèles d’embeddings, alimenter et maintenir les bases vectorielles.
  • Garantir la fraîcheur des index, la scalabilité sur des volumétries massives et la traçabilité (lignage, versioning).
  1. Recherche & pertinence (Retrieval)
  • Combiner recherche lexicale et sémantique (BM25 + embeddings), reranking et filtrage par métadonnées.
  • Mettre en place des métriques de pertinence (recall, precision, nDCG, MRR) et les faire vivre dans le temps.
  • Structurer la phase de retrieval qui alimente les LLM (RAG : contexte, citations, dé-duplication, gestion des fenêtres de contexte).
  • Instrumenter les pipelines (logs, métriques, traces qualité) et garantir la sécurité/conformité des données (RGPD, cloisonnement par pays).
  1. Leadership technique & gouvernance
  • Promouvoir une culture Clean Code, SOLID et tests automatisés.
  • Contribuer au rayonnement technique du groupe (articles, meetups, open-source).

Requirements

Profil recherchéFormationMaster, PhD ou équivalent.Compétences attenduesExpérience avérée en data engineering / information retrieval sur des volumes massifs en production.Expertise Retrieval confirmée : indexation, embeddings, recherche hybride - et capacité à mesurer puis améliorer la pertinence.Culture Data forte : pipelines reproductibles, qualité et lignage des données, versioning des datasets/index.Solide culture IA / ML (embeddings, NLP, bonne compréhension des LLM, sans nécessairement en être l’expert serving).Un plus : appétence pour d’autres langages (notamment Java) pour des sujets transverses.Anglais fluide (contexte européen quotidien).Soft skillsVision produit : vos index et votre moteur de recherche sont gérés comme un produit ; les autres développeurs sont vos clients.Leadership technique & pédagogie : capacité à évangéliser les bonnes pratiques data/retrieval/IA.Obsession de la qualité : rigueur absolue sur la sécurité des données (Legaltech oblige) et la fiabilité des services.Esprit d’innovation : curiosité pour les avancées IA, NLP et data.Communication : savoir vulgariser des concepts complexes.Python 3.11+ (maîtrise requise), GoIndexationBases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25Embeddings & NLPsentence-transformers, modèles d’embeddings, tokenisation, parsing de documentsRAG & LLMLangChain, RAG, reranking, OpenAI, Mistral, BedrockData & infraPostgreSQL, Airflow / Spark, Kafka, Redis, Docker, CI/CD, K8sTests & qualitéPytest, évaluation de pertinence (recall, nDCG, MRR), * Expérience avérée en data engineering / information retrieval sur des volumes massifs en production.

  • Expertise Retrieval confirmée : indexation, embeddings, recherche hybride - et capacité à mesurer puis améliorer la pertinence.
  • Culture Data forte : pipelines reproductibles, qualité et lignage des données, versioning des datasets/index.
  • Solide culture IA / ML (embeddings, NLP, bonne compréhension des LLM, sans nécessairement en être l’expert serving).
  • Un plus : appétence pour d’autres langages (notamment Java) pour des sujets transverses.
  • Anglais fluide (contexte européen quotidien).

Soft skills

  • Vision produit : vos index et votre moteur de recherche sont gérés comme un produit ; les autres développeurs sont vos clients.
  • Leadership technique & pédagogie : capacité à évangéliser les bonnes pratiques data/retrieval/IA.
  • Obsession de la qualité : rigueur absolue sur la sécurité des données (Legaltech oblige) et la fiabilité des services.
  • Esprit d’innovation : curiosité pour les avancées IA, NLP et data.
  • Communication : savoir vulgariser des concepts complexes.

Python 3.11+ (maîtrise requise), GoIndexationBases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25Embeddings & NLPsentence-transformers, modèles d’embeddings, tokenisation, parsing de documentsRAG & LLMLangChain, RAG, reranking, OpenAI, Mistral, BedrockData & infraPostgreSQL, Airflow / Spark, Kafka, Redis, Docker, CI/CD, K8sTests & qualitéPytest, évaluation de pertinence (recall, nDCG, MRR)

EUR

Management d’équipe Anglais Intelligence artificielle Clean Pédagogie Normalisation Python KAFKA Logiciels de gestion de versions Docker

Benefits & conditions

Taux journalier :Salaire selon profil

About the company

Rejoignez une aventure data au coeur de la Legaltech : notre client construit le moteur de recherche et d’indexation qui donnera accès, demain, à un patrimoine juridique massif et hétérogène pour plusieurs équipes à travers l’Europe.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.hellowork.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

3:55 min

Demonstrating semantic routing thresholds with the Redis vector library

2:07 min

Inspecting default bridge architectures and custom Docker networks

Oliver Seitz Oliver Seitz · World Congress 2025

2:15 min

Empowering domain teams with an open data platform

Sandhya Menon Sandhya Menon · World Congress 2026 Europe

2:37 min

Optimizing technical profiles for AI sourcing and recruitment

Mina Golesorkhi Mina Golesorkhi · World Congress 2026 Europe

3:42 min

Comparing in-memory and Redis storage for cache scalability

Simone Sanfratello · World Congress 2022

1:34 min

Bringing diverse skills to industrial data science roles

Katja Träumner

Videos

See all

Related articles

See all