Tech Lead Data Engineer - Rag - Information Retrieval avec Pré-Embauche H/F

Naxo
Paris, France
4 days ago
Apply on www.hellowork.com
Prepare application

Role details

Contract type
Temporary to permanent
Employment type
Full-time (> 32 hours)
Experience level
Expert
Working hours
Regular working hours
Languages
English

Tech stack

Clean Code Principles Artificial Intelligence Airflow Automation of Tests Continuous Integration Data Security Information Retrieval Python (Programming Language) PostgreSQL Open Source Technology Parsing Redis
+7 more
Management of Software Versions WebKit Large Language Models Apache Spark Pytest Kubernetes Docker

Job description

Concevoir des pipelines d’ingestion pour sources hétérogènes (édition, open data, bases juridiques) : parsing, nettoyage, chunking, normalisation.

  • Indexation & embeddings : choisir et industrialiser les modèles d’embeddings, maintenir les bases vectorielles, gérer la fraîcheur et la reconstruction des index.
  • Assurer scalabilité, traçabilité des données (lignage, versioning des index).
  • Définir stratégie de retrieval : combiner recherche lexicale et sémantique (BM25 + embeddings) avec reranking et filtrage par métadonnées.
  • Mettre en place évaluation continue : jeux de tests et métriques (recall, precision, nDCG, MRR).
  • Structurer la phase de récupération pour alimenter les LLM (contexte, citations, dé-duplication, gestion des fenêtres de contexte).
  • Instrumenter les pipelines (logs, métriques, traces de qualité) et garantir sécurité et conformité des données (RGPD, cloisonnement par pays).
  • Promouvoir pratiques de Clean Code, SOLID, tests automatisés.
  • Contribuer au rayonnement technique (articles, meetups, open-source) et assurer transfert de compétences.

Outils & Environnement

Requirements

Langages : Python 3.11+ (maîtrise requise), Go.

  • Indexation : bases vectorielles (pgvector, Weaviate, Qdrant, OpenSearch), recherche hybride / BM25.
  • Embeddings & NLP : sentence-transformers, modèles d’embeddings, tokenisation, parsing de documents.
  • RAG & LLM : LangChain, RAG, reranking, OpenAI, Mistral, Bedrock.
  • Data & infra : PostgreSQL, Airflow / Spark (ou équivalent), Kefka, Redis, Docker, CI/CD, K8S.
  • Tests : Pytest ; évaluation de la pertinence (recall, nDCG, MRR)., Profil recherchéMaster, PhD ou équivalentMaîtrise de Python 3.11+ et connaissance de GoExpérience avec des bases vectorielles telles que pgvector, Weaviate, Qdrant, OpenSearch et recherche hybride / BM25Compétences en embeddings et NLP : sentence-transformers, modèles d’embeddings, tokenisation, parsing de documentsConnaissance des outils RAG et LLM : LangChain, RAG, reranking, OpenAI, Mistral, BedrockMaîtrise des technologies Data & infra : PostgreSQL, Airflow / Spark (ou équivalent), Kefka, Redis, Docker, CI/CD, K8SExpérience avec les tests : Pytest et évaluation de la pertinence (recall, nDCG, MRR)Expérience avérée en data engineering / information retrieval en productionAnglais fluide (contexte européen quotidien)Qualités personnelles : vision produit, leadership technique, rigueur sur sécurité des données, communication pédagogique

Mais aussi…

Taux journalier :700.css-11k7fwb{display:inline-block;white-space:nowrap;vertical-align:middle;-webkit-padding-start:var(–chakra-space-1-5);padding-inline-start:var(–chakra-space-1-5);-webkit-padding-end:var(–chakra-space-1-5);padding-inline-end:var(–chakra-space-1-5);text-transform:none;font-size:var(–chakra-fontSizes-xs);border-radius:var(–chakra-radii-md);font-weight:var(–chakra-fontWeights-semibold);background:var(–chakra-colors-success-200);color:var(–chakra-colors-success-700);box-shadow:var(–badge-shadow);padding:4px 6px;–badge-bg:var(–chakra-colors-success-100);–badge-color:colors.success.800;}.chakra-ui-dark .css-11k7fwb:not([data-theme]),[data-theme=dark] .css-11k7fwb:not([data-theme]),.css-11k7fwb[data-theme=dark]{–badge-bg:rgba(226, 243, 232, 0.16);–badge-color:var(–chakra-colors-success-200);}Cette offre est à 0% de commission .css-74lrwu{width:1em;height:1em;line-height:1em;-webkit-flex-shrink:0;-ms-flex-negative:0;flex-shrink:0;color:currentColor;font-size:16px;display:-webkit-box;display:-webkit-flex;display:-ms-flexbox;display:flex;-webkit-transition:.1s ease-in-out color;transition:.1s ease-in-out color;}.css-74lrwu *{-webkit-transition:.1s ease-in-out fill;transition:.1s ease-in-out fill;fill:var(–chakra-colors-rythm-600);}, 1. Master, PhD ou équivalent

  1. Maîtrise de Python 3.11+ et connaissance de Go
  2. Expérience avec des bases vectorielles telles que pgvector, Weaviate, Qdrant, OpenSearch et recherche hybride / BM25
  3. Compétences en embeddings et NLP : sentence-transformers, modèles d’embeddings, tokenisation, parsing de documents
  4. Connaissance des outils RAG et LLM : LangChain, RAG, reranking, OpenAI, Mistral, Bedrock
  5. Maîtrise des technologies Data & infra : PostgreSQL, Airflow / Spark (ou équivalent), Kefka, Redis, Docker, CI/CD, K8S
  6. Expérience avec les tests : Pytest et évaluation de la pertinence (recall, nDCG, MRR)
  7. Expérience avérée en data engineering / information retrieval en production
  8. Anglais fluide (contexte européen quotidien)
  9. Qualités personnelles : vision produit, leadership technique, rigueur sur sécurité des données, communication pédagogique, Anglais Intelligence artificielle Normalisation Python PostgreSQL Docker

Benefits & conditions

PRE EMBAUCHE - 6 mois de mission maximum. Aux côtés d’une équipe d’experts au sein d’un pôle AI, vous serez responsable de la collecte, de l’ingestion, de l’indexation et de la recherche de pertinence sur des volumes juridiques massifs pour alimenter des modèles de langage et des produits. Enjeu : garantir la fraîcheur des index, la qualité du retrieval et la scalabilité face à une volumétrie et une hétérogénéité de sources importantes. Localisation : Europe., Mission pré-embauche de 6 mois maximum.

  • Localisation : Europe.
  • Contexte européen avec anglais fluide requis.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.hellowork.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

3:55 min

Demonstrating semantic routing thresholds with the Redis vector library

2:07 min

Inspecting default bridge architectures and custom Docker networks

Oliver Seitz Oliver Seitz · World Congress 2025

3:05 min

Tagging and organizing execution scenarios with pytest markers

Florian Bruhin · World Congress 2021

2:37 min

Optimizing technical profiles for AI sourcing and recruitment

Mina Golesorkhi Mina Golesorkhi · World Congress 2026 Europe

3:42 min

Comparing in-memory and Redis storage for cache scalability

Simone Sanfratello · World Congress 2022

3:14 min

Structuring career paths and localized data architectures

Ulrich Wurstbauer +1 · LIVE

Videos

See all

Related articles

See all