Expert Data & Retrieval - Legaltech H/F

Salutech
France
5 days ago
Apply on www.hellowork.com
Prepare application

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience level
Expert
Working hours
Regular working hours
Languages
English

Tech stack

Clean Code Principles Java (Programming Language) Artificial Intelligence Airflow Automation of Tests Continuous Integration Data Security Information Retrieval Python (Programming Language) PostgreSQL Open Source Technology Parsing
+8 more
Redis Management of Software Versions Planning Software Large Language Models Apache Spark Pytest Kubernetes Docker

Job description

Aux côtés d’une équipe d’experts passionnés au sein de l’équipe AI Service, vous relèverez les plus hauts défis techniques de la société, et du marché de l’édition juridique. En tant qu’Expert Data & Retrieval, vous êtes le garant de la matière première de notre IA : la collecte, l’ingestion, l’indexation et la recherche de pertinence sur des volumes juridiques massifs, le socle qui alimente nos modèles de langage et nos produits. Votre terrain de jeu : transformer la manière dont tout un secteur, le droit, travaille au quotidien., Votre mission n’est pas d’écrire un simple script, mais de concevoir des pipelines de données robustes capables d’ingérer, de nettoyer et d’indexer d’énormes corpus juridiques, puis d’exposer une recherche rapide et pertinente (sémantique et hybride) au service de plusieurs équipes à travers l’Europe. Vous garantirez la fraîcheur des index et la qualité du retrieval tout en gérant une complexité technique de haut vol (volumétrie, hétérogénéité des sources, évaluation de la pertinence, scalabilité…).

Vos missions principales : bâtir, outiller, transmettre

  • Collecte, ingestion & indexation

  • Pipelines d’ingestion : concevoir la collecte et le traitement de sources hétérogènes (édition, open data, bases juridiques), le parsing, le nettoyage, le chunking et la normalisation des documents.
  • Indexation & embeddings : choisir et industrialiser les modèles d’embeddings, alimenter et maintenir les bases vectorielles, gérer la fraîcheur et la reconstruction des index.
  • Qualité & volumétrie : garantir la scalabilité de l’indexation sur des corpus massifs et la traçabilité des données (lignage, versioning des index).
  • Recherche & pertinence (Retrieval)

  • Stratégie de retrieval : combiner recherche lexicale et sémantique (BM25 + embeddings) avec reranking et filtrage par métadonnées pour maximiser la pertinence.
  • Évaluation continue : mettre en place des jeux de tests et des métriques de pertinence (recall, precision, nDCG, MRR) pour mesurer et améliorer le retrieval.
  • RAG : structurer la phase de récupération qui alimente les LLM (contexte, citations, dé-duplication, gestion des fenêtres de contexte).
  • Observability & Security : instrumenter les pipelines (logs, métriques, traces de qualité) et garantir la sécurité et la conformité des données juridiques (RGPD, cloisonnement par pays).
  • Leadership Technique & Gouvernance

  • Culture Craftsmanship : promouvoir les pratiques de Clean Code, SOLID, et tests automatisés.
  • Rayonnement : assurer une veille constante et contribuer au rayonnement technique du groupe (articles, meetups, open-source).

Stack technique

  • Langages : Python 3.11+ (maîtrise requise), Go.
  • Indexation : bases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25.
  • Embeddings & NLP : sentence-transformers, modèles d’embeddings, tokenisation, parsing de documents.
  • RAG & LLM : LangChain, RAG, reranking, OpenAI, Mistral, Bedrock.
  • Data & infra : PostgreSQL, Airflow / Spark (ou équivalent), Kefka, Redis, Docker, CI/CD, K8S.
  • Tests : Pytest ; évaluation de la pertinence (recall, nDCG, MRR).

Requirements

Diplôme : Master, PhD, ou équivalent., Profil recherchéDiplôme : Master, PhD, ou équivalentMaîtrise requise de Python 3.11+Connaissance de GoExpérience avec bases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch) et recherche hybride / BM25Compétences en embeddings & NLP : sentence-transformers, modèles d’embeddings, tokenisation, parsing de documentsExpérience avec RAG & LLM : LangChain, RAG, reranking, OpenAI, Mistral, BedrockConnaissances en data & infra : PostgreSQL, Airflow / Spark (ou équivalent), Kefka, Redis, Docker, CI/CD, K8SMaîtrise des tests : Pytest ; évaluation de la pertinence (recall, nDCG, MRR)Expérience avérée en data engineering / information retrieval sur des volumes massifs en productionExpertise Retrieval : maîtrise de l’indexation, des embeddings et de la recherche hybride, capacité à mesurer et améliorer la pertinenceCulture Data : pipelines reproductibles, qualité et lignage des données, versioning des datasets et des indexSolide culture IA / ML
embeddings, NLP et bonne compréhension des LLMPolyvalence appréciée, notamment une appétence pour JavaAnglais fluide (contexte européen quotidien)Vision Produit : compréhension des enjeux métiers du droit pour prioriser les fonctionnalitésLeadership Technique & pédagogie : capacité à évangéliser les bonnes pratiques data, retrieval et IAObsession de la Qualité : rigueur sur la sécurité des données et la fiabilité des servicesEsprit d’innovation : curiosité pour les avancées de l’écosystème IA, NLP et dataCommunication : savoir vulgariser des concepts complexes, 1. Diplôme : Master, PhD, ou équivalent
  1. Maîtrise requise de Python 3.11+
  2. Connaissance de Go
  3. Expérience avec bases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch) et recherche hybride / BM25
  4. Compétences en embeddings & NLP : sentence-transformers, modèles d’embeddings, tokenisation, parsing de documents
  5. Expérience avec RAG & LLM : LangChain, RAG, reranking, OpenAI, Mistral, Bedrock
  6. Connaissances en data & infra : PostgreSQL, Airflow / Spark (ou équivalent), Kefka, Redis, Docker, CI/CD, K8S
  7. Maîtrise des tests : Pytest ; évaluation de la pertinence (recall, nDCG, MRR)
  8. Expérience avérée en data engineering / information retrieval sur des volumes massifs en production
  9. Expertise Retrieval : maîtrise de l’indexation, des embeddings et de la recherche hybride, capacité à mesurer et améliorer la pertinence
  10. Culture Data : pipelines reproductibles, qualité et lignage des données, versioning des datasets et des index
  11. Solide culture IA / ML : embeddings, NLP et bonne compréhension des LLM
  12. Polyvalence appréciée, notamment une appétence pour Java
  13. Anglais fluide (contexte européen quotidien)
  14. Vision Produit : compréhension des enjeux métiers du droit pour prioriser les fonctionnalités
  15. Leadership Technique & pédagogie : capacité à évangéliser les bonnes pratiques data, retrieval et IA
  16. Obsession de la Qualité : rigueur sur la sécurité des données et la fiabilité des services
  17. Esprit d’innovation : curiosité pour les avancées de l’écosystème IA, NLP et data
  18. Communication : savoir vulgariser des concepts complexes

EUR

Management d’équipe Anglais Intelligence artificielle Clean Pédagogie Normalisation Python Capacité d’adaptation PostgreSQL Logiciels de gestion de versions Docker

Benefits & conditions

Fourchette de rémunération, Taux journalier :Salaire selon profil

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.hellowork.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

3:55 min

Demonstrating semantic routing thresholds with the Redis vector library

2:07 min

Inspecting default bridge architectures and custom Docker networks

Oliver Seitz Oliver Seitz · World Congress 2025

3:05 min

Tagging and organizing execution scenarios with pytest markers

Florian Bruhin · World Congress 2021

2:37 min

Optimizing technical profiles for AI sourcing and recruitment

Mina Golesorkhi Mina Golesorkhi · World Congress 2026 Europe

3:42 min

Comparing in-memory and Redis storage for cache scalability

Simone Sanfratello · World Congress 2022

3:14 min

Structuring career paths and localized data architectures

Ulrich Wurstbauer +1 · LIVE

Videos

See all

Related articles

See all