Tech Lead Expert Data Retrieval & Rag Legaltech - Pré Embauche - Client Final H/F

Tech Lead
France
4 days ago
Apply on www.hellowork.com
Prepare application

Role details

Contract type
Temporary to permanent
Employment type
Full-time (> 32 hours)
Experience level
Expert
Working hours
Regular working hours
Languages
English

Tech stack

Clean Code Principles Artificial Intelligence Airflow Automation of Tests Continuous Integration Information Retrieval Python (Programming Language) PostgreSQL Open Source Technology Redis Management of Software Versions WebKit
+5 more
Large Language Models Apache Spark Pytest Kubernetes Docker

Job description

Tech lead Expert Data Retrieval RAG. PRE EMBAUCHE - 6 mois de mission maximum. Au sein de l’équipe AI Service, vous contribuerez à la conception de pipelines d’ingestion, d’indexation et de recherche pour des corpus juridiques massifs. Enjeu : garantir la fraîcheur et la qualité du retrieval (sémantique et hybride) pour des équipes réparties en Europe, en respectant la sécurité et la conformité des données (RGPD, cloisonnement par pays)., Collecte, ingestion & indexation : concevoir des pipelines pour sources hétérogènes (parsing, nettoyage, chunking, normalisation), industrialiser modèles d’embeddings, alimenter et maintenir bases vectorielles, gérer fraîcheur et reconstruction des index, garantir scalabilité et traçabilité (lignage, versioning).

  • Recherche & pertinence (Retrieval) : piloter stratégie combinant recherche lexicale et sémantique (BM25 + embeddings), reranking et filtrage par métadonnées ; structurer la phase de récupération pour alimenter les LLM (contexte, citations, dé-duplication, gestion des fenêtres de contexte) ; mettre en place jeux de tests et métriques (recall, precision, nDCG, MRR) ; instrumenter pipelines (logs, métriques, traces de qualité) et garantir observability et security.
  • Leadership technique & gouvernance : promouvoir Clean Code, SOLID, tests automatisés ; assurer veille, documentation et rayonnement technique (articles, meetups, open-source). Livrables : pipelines reproductibles, index robustes et métriques de pertinence opérationnelles.

Outils & Environnement

  • Langages : Python 3.11+ (maîtrise requise), Go
  • Indexation : bases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25
  • Embeddings & NLP : sentence-transformers, modèles d’embeddings, tokenisation, parsing de documents
  • RAG & LLM : LangChain, RAG, reranking, OpenAI, Mistral, Bedrock
  • Data & infra : PostgreSQL, Airflow / Spark (ou équivalent), Kefka, Redis, Docker, CI/CD, K8S
  • Tests : Pytest ; évaluation de la pertinence (recall, nDCG, MRR)

Conditions de travail

  • Pré embauche
  • Mission de 6 mois maximum
  • Contexte européen avec équipes réparties en Europe
  • Respect des normes RGPD et cloisonnement par pays

Requirements

Profil recherchéMaster, PhD, ou équivalentMaîtrise de Python 3.11+ et connaissance de GoExpérience avec des bases vectorielles telles que pgvector, Weaviate, Qdrant, OpenSearch et recherche hybride / BM25Compétences en embeddings et NLP : sentence-transformers, modèles d’embeddings, tokenisation, parsing de documentsConnaissance des outils RAG et LLM : LangChain, RAG, reranking, OpenAI, Mistral, BedrockCompétences en data & infrastructure : PostgreSQL, Airflow / Spark (ou équivalent), Kefka, Redis, Docker, CI/CD, K8SMaîtrise des tests avec Pytest et évaluation de la pertinence (recall, nDCG, MRR)Expérience avérée en data engineering / information retrieval en productionExpertise en retrieval, pipelines reproductibles, culture IA/MLAnglais fluide (contexte européen quotidien)Qualités personnelles : vision produit, pédagogie, rigueur sécurité, curiosité innovation, communication claire

Mais aussi…

Taux journalier :800.css-11k7fwb{display:inline-block;white-space:nowrap;vertical-align:middle;-webkit-padding-start:var(–chakra-space-1-5);padding-inline-start:var(–chakra-space-1-5);-webkit-padding-end:var(–chakra-space-1-5);padding-inline-end:var(–chakra-space-1-5);text-transform:none;font-size:var(–chakra-fontSizes-xs);border-radius:var(–chakra-radii-md);font-weight:var(–chakra-fontWeights-semibold);background:var(–chakra-colors-success-200);color:var(–chakra-colors-success-700);box-shadow:var(–badge-shadow);padding:4px 6px;–badge-bg:var(–chakra-colors-success-100);–badge-color:colors.success.800;}.chakra-ui-dark .css-11k7fwb:not([data-theme]),[data-theme=dark] .css-11k7fwb:not([data-theme]),.css-11k7fwb[data-theme=dark]{–badge-bg:rgba(226, 243, 232, 0.16);–badge-color:var(–chakra-colors-success-200);}Cette offre est à 0% de commission .css-74lrwu{width:1em;height:1em;line-height:1em;-webkit-flex-shrink:0;-ms-flex-negative:0;flex-shrink:0;color:currentColor;font-size:16px;display:-webkit-box;display:-webkit-flex;display:-ms-flexbox;display:flex;-webkit-transition:.1s ease-in-out color;transition:.1s ease-in-out color;}.css-74lrwu *{-webkit-transition:.1s ease-in-out fill;transition:.1s ease-in-out fill;fill:var(–chakra-colors-rythm-600);}, 1. Master, PhD, ou équivalent

  1. Maîtrise de Python 3.11+ et connaissance de Go
  2. Expérience avec des bases vectorielles telles que pgvector, Weaviate, Qdrant, OpenSearch et recherche hybride / BM25
  3. Compétences en embeddings et NLP : sentence-transformers, modèles d’embeddings, tokenisation, parsing de documents
  4. Connaissance des outils RAG et LLM : LangChain, RAG, reranking, OpenAI, Mistral, Bedrock
  5. Compétences en data & infrastructure : PostgreSQL, Airflow / Spark (ou équivalent), Kefka, Redis, Docker, CI/CD, K8S
  6. Maîtrise des tests avec Pytest et évaluation de la pertinence (recall, nDCG, MRR)
  7. Expérience avérée en data engineering / information retrieval en production
  8. Expertise en retrieval, pipelines reproductibles, culture IA/ML
  9. Anglais fluide (contexte européen quotidien)
  10. Qualités personnelles : vision produit, pédagogie, rigueur sécurité, curiosité innovation, communication claire

EUR

Anglais Intelligence artificielle Clean Normalisation Python PostgreSQL Docker

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.hellowork.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

3:55 min

Demonstrating semantic routing thresholds with the Redis vector library

2:07 min

Inspecting default bridge architectures and custom Docker networks

Oliver Seitz Oliver Seitz · World Congress 2025

3:05 min

Tagging and organizing execution scenarios with pytest markers

Florian Bruhin · World Congress 2021

2:37 min

Optimizing technical profiles for AI sourcing and recruitment

Mina Golesorkhi Mina Golesorkhi · World Congress 2026 Europe

3:42 min

Comparing in-memory and Redis storage for cache scalability

Simone Sanfratello · World Congress 2022

3:09 min

Balancing data science skillings alongside systems engineering rigor

Nico Schmidt · LIVE

Videos

See all

Related articles

See all