> Markdown version of [/jobs/ext/3007709-tech-lead-expert-data-retrieval-rag-h-f](https://www.wearedevelopers.com/jobs/ext/3007709-tech-lead-expert-data-retrieval-rag-h-f). Every page supports `.md` or `Accept: text/markdown`. Links point to the HTML versions so they work for humans too. Agent guide: [/agents.md](https://www.wearedevelopers.com/agents.md). --- # Tech Lead Expert Data Retrieval Rag H/F - **Company:** Soft Skillsvision Produit - **Location:** France - **Experience:** Expert - **Contract:** Permanent contract - **Skills:** Clean Code Principles, Java (Programming Language), Artificial Intelligence, Airflow, Automation of Tests, Continuous Integration, Data Security, Information Retrieval, Python (Programming Language), Open Source Technology, Parsing, Redis, Management of Software Versions, Planning Software, Large Language Models, Apache Spark, Apache Kafka, Search Engines, Docker - **Published:** September 20, 2026 - **Apply:** https://www.hellowork.com/fr-fr/emplois/83566707.html ## About the Role Profil recherchéFormationMaster, PhD ou équivalent.Compétences attenduesExpérience avérée en data engineering / information retrieval sur des volumes massifs en production.Expertise Retrieval confirmée : indexation, embeddings, recherche hybride - et capacité à mesurer puis améliorer la pertinence.Culture Data forte : pipelines reproductibles, qualité et lignage des données, versioning des datasets/index.Solide culture IA / ML (embeddings, NLP, bonne compréhension des LLM, sans nécessairement en être l'expert serving).Un plus : appétence pour d'autres langages (notamment Java) pour des sujets transverses.Anglais fluide (contexte européen quotidien).Soft skillsVision produit : vos index et votre moteur de recherche sont gérés comme un produit ; les autres développeurs sont vos clients.Leadership technique & pédagogie : capacité à évangéliser les bonnes pratiques data/retrieval/IA.Obsession de la qualité : rigueur absolue sur la sécurité des données (Legaltech oblige) et la fiabilité des services.Esprit d'innovation : curiosité pour les avancées IA, NLP et data.Communication : savoir vulgariser des concepts complexes.Python 3.11+ (maîtrise requise), GoIndexationBases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25Embeddings & NLPsentence-transformers, modèles d'embeddings, tokenisation, parsing de documentsRAG & LLMLangChain, RAG, reranking, OpenAI, Mistral, BedrockData & infraPostgreSQL, Airflow / Spark, Kafka, Redis, Docker, CI/CD, K8sTests & qualitéPytest, évaluation de pertinence (recall, nDCG, MRR), * Expérience avérée en data engineering / information retrieval sur des volumes massifs en production. * Expertise Retrieval confirmée : indexation, embeddings, recherche hybride - et capacité à mesurer puis améliorer la pertinence. * Culture Data forte : pipelines reproductibles, qualité et lignage des données, versioning des datasets/index. * Solide culture IA / ML (embeddings, NLP, bonne compréhension des LLM, sans nécessairement en être l'expert serving). * Un plus : appétence pour d'autres langages (notamment Java) pour des sujets transverses. * Anglais fluide (contexte européen quotidien). Soft skills * Vision produit : vos index et votre moteur de recherche sont gérés comme un produit ; les autres développeurs sont vos clients. * Leadership technique & pédagogie : capacité à évangéliser les bonnes pratiques data/retrieval/IA. * Obsession de la qualité : rigueur absolue sur la sécurité des données (Legaltech oblige) et la fiabilité des services. * Esprit d'innovation : curiosité pour les avancées IA, NLP et data. * Communication : savoir vulgariser des concepts complexes. Python 3.11+ (maîtrise requise), GoIndexationBases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25Embeddings & NLPsentence-transformers, modèles d'embeddings, tokenisation, parsing de documentsRAG & LLMLangChain, RAG, reranking, OpenAI, Mistral, BedrockData & infraPostgreSQL, Airflow / Spark, Kafka, Redis, Docker, CI/CD, K8sTests & qualitéPytest, évaluation de pertinence (recall, nDCG, MRR) EUR Management d'équipe Anglais Intelligence artificielle Clean Pédagogie Normalisation Python KAFKA Logiciels de gestion de versions Docker ## Description Votre mission n'est pas d'écrire un simple script : c'est de concevoir des pipelines de données robustes, capables d'ingérer, nettoyer et indexer d'énormes corpus juridiques, puis d'exposer une recherche rapide, pertinente et hybride (sémantique + lexicale) à grande échelle. Vos missions au quotidien 1. Collecte, ingestion & indexation - Concevoir des pipelines d'ingestion sur des sources hétérogènes (édition, open data, bases juridiques) : parsing, nettoyage, chunking, normalisation. - Choisir et industrialiser les modèles d'embeddings, alimenter et maintenir les bases vectorielles. - Garantir la fraîcheur des index, la scalabilité sur des volumétries massives et la traçabilité (lignage, versioning). 2. Recherche & pertinence (Retrieval) - Combiner recherche lexicale et sémantique (BM25 + embeddings), reranking et filtrage par métadonnées. - Mettre en place des métriques de pertinence (recall, precision, nDCG, MRR) et les faire vivre dans le temps. - Structurer la phase de retrieval qui alimente les LLM (RAG : contexte, citations, dé-duplication, gestion des fenêtres de contexte). - Instrumenter les pipelines (logs, métriques, traces qualité) et garantir la sécurité/conformité des données (RGPD, cloisonnement par pays). 3. Leadership technique & gouvernance - Promouvoir une culture Clean Code, SOLID et tests automatisés. - Contribuer au rayonnement technique du groupe (articles, meetups, open-source). ## Related Videos - [From Messy Queries to Scalable Systems - How Data Engineering actually works](https://www.wearedevelopers.com/videos/100203-from-messy-queries-to-scalable-systems-how-data-engineering-actually-works) - [Carl Lapierre - Exploring Advanced Patterns in Retrieval-Augmented Generation](https://www.wearedevelopers.com/videos/1235-carl-lapierre-exploring-advanced-patterns-in-retrieval-augmented-generation) - [Docker Compose: Rediscovered](https://www.wearedevelopers.com/videos/1978-docker-compose-rediscovered) - [Reducing LLM Calls with Vector Search Patterns - Raphael De Lio (Redis)](https://www.wearedevelopers.com/videos/1714-reducing-llm-calls-with-vector-search-patterns-raphael-de-lio-redis) - [AI Model Management Life Circles: ML Ops For Generative AI Models From Research to Deployment](https://www.wearedevelopers.com/videos/1152-ai-model-management-life-circles-ml-ops-for-generative-ai-models-from-research-to-deployment) - [Docker build without Docker](https://www.wearedevelopers.com/videos/100114-docker-build-without-docker) ## Related Articles - [Résumé-Driven Development: How IT trends affect the job market for software developers](https://www.wearedevelopers.com/magazine/59-resume-driven-development-how-it-trends-affect-the-job-market-for-software-developers) - [Dev Digest 121 - AI goes offline](https://www.wearedevelopers.com/magazine/456-dev-digest-121-ai-goes-offline) - [Dev Digest 120 - Apple and peers](https://www.wearedevelopers.com/magazine/455-dev-digest-120-apple-and-peers) - [Data Engineer Salary UK](https://www.wearedevelopers.com/magazine/253-data-engineer-salary-uk) - [Best Companies to Work For in Paris: Top 25 Companies in 2023 ](https://www.wearedevelopers.com/magazine/190-best-companies-to-work-for-in-paris-top-25-companies-in-2023) - [Is Software Engineering Over-Saturated?](https://www.wearedevelopers.com/magazine/418-is-software-engineering-over-saturated)