Tech Lead Expert Data Retrieval Rag H/F
- Discuss this with your agent
- Open in Claude
- Open in ChatGPT
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Role details
Tech stack
+7 more
Job description
Votre mission n’est pas d’écrire un simple script : c’est de concevoir des pipelines de données robustes, capables d’ingérer, nettoyer et indexer d’énormes corpus juridiques, puis d’exposer une recherche rapide, pertinente et hybride (sémantique + lexicale) à grande échelle.
Vos missions au quotidien
- Collecte, ingestion & indexation
- Concevoir des pipelines d’ingestion sur des sources hétérogènes (édition, open data, bases juridiques) : parsing, nettoyage, chunking, normalisation.
- Choisir et industrialiser les modèles d’embeddings, alimenter et maintenir les bases vectorielles.
- Garantir la fraîcheur des index, la scalabilité sur des volumétries massives et la traçabilité (lignage, versioning).
- Recherche & pertinence (Retrieval)
- Combiner recherche lexicale et sémantique (BM25 + embeddings), reranking et filtrage par métadonnées.
- Mettre en place des métriques de pertinence (recall, precision, nDCG, MRR) et les faire vivre dans le temps.
- Structurer la phase de retrieval qui alimente les LLM (RAG : contexte, citations, dé-duplication, gestion des fenêtres de contexte).
- Instrumenter les pipelines (logs, métriques, traces qualité) et garantir la sécurité/conformité des données (RGPD, cloisonnement par pays).
- Leadership technique & gouvernance
- Promouvoir une culture Clean Code, SOLID et tests automatisés.
- Contribuer au rayonnement technique du groupe (articles, meetups, open-source).
Requirements
Profil recherchéFormationMaster, PhD ou équivalent.Compétences attenduesExpérience avérée en data engineering / information retrieval sur des volumes massifs en production.Expertise Retrieval confirmée : indexation, embeddings, recherche hybride - et capacité à mesurer puis améliorer la pertinence.Culture Data forte : pipelines reproductibles, qualité et lignage des données, versioning des datasets/index.Solide culture IA / ML (embeddings, NLP, bonne compréhension des LLM, sans nécessairement en être l’expert serving).Un plus : appétence pour d’autres langages (notamment Java) pour des sujets transverses.Anglais fluide (contexte européen quotidien).Soft skillsVision produit : vos index et votre moteur de recherche sont gérés comme un produit ; les autres développeurs sont vos clients.Leadership technique & pédagogie : capacité à évangéliser les bonnes pratiques data/retrieval/IA.Obsession de la qualité : rigueur absolue sur la sécurité des données (Legaltech oblige) et la fiabilité des services.Esprit d’innovation : curiosité pour les avancées IA, NLP et data.Communication : savoir vulgariser des concepts complexes.Python 3.11+ (maîtrise requise), GoIndexationBases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25Embeddings & NLPsentence-transformers, modèles d’embeddings, tokenisation, parsing de documentsRAG & LLMLangChain, RAG, reranking, OpenAI, Mistral, BedrockData & infraPostgreSQL, Airflow / Spark, Kafka, Redis, Docker, CI/CD, K8sTests & qualitéPytest, évaluation de pertinence (recall, nDCG, MRR), * Expérience avérée en data engineering / information retrieval sur des volumes massifs en production.
- Expertise Retrieval confirmée : indexation, embeddings, recherche hybride - et capacité à mesurer puis améliorer la pertinence.
- Culture Data forte : pipelines reproductibles, qualité et lignage des données, versioning des datasets/index.
- Solide culture IA / ML (embeddings, NLP, bonne compréhension des LLM, sans nécessairement en être l’expert serving).
- Un plus : appétence pour d’autres langages (notamment Java) pour des sujets transverses.
- Anglais fluide (contexte européen quotidien).
Soft skills
- Vision produit : vos index et votre moteur de recherche sont gérés comme un produit ; les autres développeurs sont vos clients.
- Leadership technique & pédagogie : capacité à évangéliser les bonnes pratiques data/retrieval/IA.
- Obsession de la qualité : rigueur absolue sur la sécurité des données (Legaltech oblige) et la fiabilité des services.
- Esprit d’innovation : curiosité pour les avancées IA, NLP et data.
- Communication : savoir vulgariser des concepts complexes.
Python 3.11+ (maîtrise requise), GoIndexationBases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25Embeddings & NLPsentence-transformers, modèles d’embeddings, tokenisation, parsing de documentsRAG & LLMLangChain, RAG, reranking, OpenAI, Mistral, BedrockData & infraPostgreSQL, Airflow / Spark, Kafka, Redis, Docker, CI/CD, K8sTests & qualitéPytest, évaluation de pertinence (recall, nDCG, MRR)
EUR
Management d’équipe Anglais Intelligence artificielle Clean Pédagogie Normalisation Python KAFKA Logiciels de gestion de versions Docker
Benefits & conditions
Taux journalier :Salaire selon profil
About the company
Rejoignez une aventure data au coeur de la Legaltech : notre client construit le moteur de recherche et d’indexation qui donnera accès, demain, à un patrimoine juridique massif et hétérogène pour plusieurs équipes à travers l’Europe.
Apply for this position
This job is hosted externally. Click below to view the full posting and apply.
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Good distractions
Talks and stories from around this role — technically off-topic, practically not.
Moments
Explore playlistsVideos
See allRelated articles
See all
Dev Digest 121 - AI goes offline
Dev Digest 120 - Apple and peers
Data Engineer Salary UK
Best Companies to Work For in Paris: Top 25 Companies in 2023Â