Data Engineer Confirmé - Intelligence Artificielle H/F

Ia & Innovation
Paris, France
7 days ago
Apply on www.hellowork.com
Prepare application

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience level
Experienced
Experience required
5 years minimum
Working hours
Regular working hours

Tech stack

Application Programming Interfaces (APIs) Artificial Intelligence Airflow Software Applications Cloud Computing Data Architecture Information Engineering Data Governance Elasticsearch JSON Python (Programming Language) Knowledge Management
+18 more
Machine Learning Metadata Open Data Protocol SQL Databases Parquet Large Language Models Generative AI Git Pandas Pyspark Gitlab-ci Kubernetes Information Technology Search Engines Data Management Machine Learning Operations Restful APIs Docker

Job description

Au sein du département des projets et de la maintenance des applications, la cellule IA & Innovation, composée de trois data scientist et deux développeurs, accompagne la transformation numérique du Conseil d’État et des juridictions administratives par l’expérimentation, la conception et l’industrialisation de solutions innovantes fondées notamment sur l’intelligence artificielle, la valorisation des données et l’automatisation des processus.

Elle intervient en appui des équipes métiers et des projets numériques afin d’identifier les usages à forte valeur ajoutée, de construire les plateformes techniques nécessaires à leur déploiement et de garantir leur intégration dans un cadre sécurisé, souverain et conforme aux exigences de l’administration.

Effectif de la cellule : 6

Sous l’autorité du responsable de la cellule IA & Innovation,vous conçevez et exploitez les architectures de données nécessaires aux projets d’intelligence artificielle du Conseil d’État et des juridictions administratives.

Vous garantissez la mise à disposition de données fiables, disponibles, traçables et sécurisées, et contribue à l’industrialisation des traitements associés. En collaboration avec les Data Scientists, les équipes projets et les experts métiers,vous interviennez notamment sur les bases documentaires Ariane, ArianeWeb, ConsiliaWeb, Légifrance et l’Open data., Ingénierie des données:

  • Organiser et automatiser la collecte, la préparation et la mise à disposition des données ;
  • Développer et maintenir les échanges nécessaires aux applications métiers et aux équipes de Data Science ;
  • Accompagner les équipes projets dans l’exploitation et la valorisation de leurs données.

Infrastructure pour l’Intelligence Artificielle et le MLOps:

  • Contribuer à l’architecture et à la mise en oeuvre des solutions RAG ;
  • Prendre en charge les chaînes d’indexation, de vectorisation et de recherche documentaire ainsi que les référentiels associés ;
  • Préparer et alimenter les données nécessaires aux modèles d’IA et de Machine Learning, sans intervenir dans leur conception.

Qualité, Gouvernance et exploitation :

  • Mettre en place les contrôles garantissant la qualité, la cohérence, la traçabilité et le versionnement des données ;
  • Superviser les traitements, contribuer à leur observabilité et à la définition des standards techniques de gestion des données ;
  • Assurer une veille sur les outils de Data Engineering, d’intelligence artificielle et de gestion des connaissances.

Objectifs du poste:

  • Fiabiliser les données nécessaires aux usages de l’IA générative, analytique et prédictive ;
  • Industrialiser les flux et garantir leur qualité dans la durée ;
  • Favoriser l’exploitation sécurisée du patrimoine documentaire et des données du Conseil d’État ;
  • Contribuer au développement de solutions d’IA souveraines pour la recherche documentaire, l’analyse juridique et l’assistance à la rédaction.

Télétravail: 2 jours par semaine

Pour information : le déménagement du service estprévue en novembre2026 quai Voltaire (Paris 7ème)., Au sein du département des projets et de la maintenance des applications, la cellule IA & Innovation, composée de trois data scientist et deux développeurs, accompagne la transformation numérique du Conseil d’État et des juridictions administratives par l’expérimentation, la conception et l’industrialisation de solutions innovantes fondées notamment sur l’intelligence artificielle, la valorisation des données et l’automatisation des processus.Elle intervient en appui des équipes métiers et des projets numériques afin d’identifier les usages à forte valeur ajoutée, de construire les plateformes techniques nécessaires à leur déploiement et de garantir leur intégration dans un cadre sécurisé, souverain et conforme aux exigences de l’administration.Effectif de la cellule : 6, Data engineering appliqué aux systèmes RAG

  • Concevoir et industrialiser des pipelines d’ingestion, de transformation et d’indexation de données documentaires ;
  • Préparer des documents, notamment juridiques, pour leur exploitation par des LLM : extraction des contenus et métadonnées, nettoyage, chunking, enrichissement et vectorisation ;
  • Mettre en oeuvre et optimiser des chaînes d’indexation et de recherche sémantique ou hybride reposant sur les embeddings, les moteurs de recherche et les bases vectorielles ;
  • Assurer l’orchestration, la supervision, la traçabilité, le versionnement et la reprise sur erreur des traitements ;
  • Garantir la qualité et la gouvernance des données, métadonnées et index ;
  • Maîtriser les principes des LLM, de l’IA générative et des architectures RAG ;
  • Contribuer, avec les Data Scientists et les développeurs, à la constitution des jeux de test et à l’évaluation des systèmes RAG : pertinence de la recherche, fiabilité des réponses, sources et performances.

Requirements

Vous avez un Bac +5 (école d’ingénieur ou master spécialisé en informatique, intelligence artificielle, cloud computing ou data engineering) et au moins 5 ans d’expérience en data engineering, notamment dans la conception et l’exploitation de pipelines de données.Vous possédez :- de projets associant LLM, recherche documentaire, embeddings et bases vectorielles, idéalement dans une architecture RAG ;- de l’industrialisation de traitements de données et de la mise en oeuvre d’API ;- de projets d’IA ou d’un environnement public, sensible ou réglementé est appréciée. Compétencesrequises :Data engineering appliqué aux systèmes RAGConcevoir et industrialiser des pipelines d’ingestion, de transformation et d’indexation de données documentaires ;Préparer des documents, notamment juridiques, pour leur exploitation par des LLM : extraction des contenus et métadonnées, nettoyage, chunking, enrichissement et vectorisation ;Mettre en oeuvre et optimiser des chaînes d’indexation et de recherche sémantique ou hybride reposant sur les embeddings, les moteurs de recherche et les bases vectorielles ;Assurer l’orchestration, la supervision, la traçabilité, le versionnement et la reprise sur erreur des traitements ;Garantir la qualité et la gouvernance des données, métadonnées et index ;Maîtriser les principes des LLM, de l’IA générative et des architectures RAG ;Contribuer, avec les Data Scientists et les développeurs, à la constitution des jeux de test et à l’évaluation des systèmes RAG : pertinence de la recherche, fiabilité des réponses, sources et performances.TechnologieExcellente maîtrise de Python et SQL ;Expérience des outils de traitement et d’orchestration des données : Pandas, PySpark, Airflow ou équivalents ;Expérience des moteurs de recherche et bases vectorielles : OpenSearch, Elasticsearch, Qdrant, Weaviate ou équivalents ;Connaissance d’un framework RAG : LangChain, LlamaIndex ou équivalent ;Maîtrise des API REST et des formats JSON, Parquet et CSV ;Pratique de Git, GitLab CI/CD et Docker ; Kubernetes est un atout.SécuritéConnaissance des principes de protection, de traçabilité et de gestion des accès aux données. Une connaissance des exigences de sécurité applicables aux administrations publiques est appréciée.- Savoir- faire :Intégrer et fiabiliser des sources de données hétérogènes. Analyser et optimiser les performances des pipelines et des systèmes d’indexation ;- Savoir-être:Rigueur, esprit d’analyse, autonomie, curiosité, force de proposition, sens du collectif et capacité à vulgariser.Pour candidater :Votre candidature doit obligatoirement être déposée sur la plateforme Choisir le service public.Elle comprendra impérativement une lettre de motivation et un CV dans lesquels vous préciserez votre statut (contractuel ou fonctionnaire).Toute candidature adressée horsprocédure ne sera pas prise en compte., Vous avez un Bac +5 (école d’ingénieur ou master spécialisé en informatique, intelligence artificielle, cloud computing ou data engineering) et au moins 5 ans d’expérience en data engineering, notamment dans la conception et l’exploitation de pipelines de données., de projets associant LLM, recherche documentaire, embeddings et bases vectorielles, idéalement dans une architecture RAG ;

  • de l’industrialisation de traitements de données et de la mise en oeuvre d’API ;

  • de projets d’IA ou d’un environnement public, sensible ou réglementé est appréciée., * Excellente maîtrise de Python et SQL ;
  • Expérience des outils de traitement et d’orchestration des données : Pandas, PySpark, Airflow ou équivalents ;
  • Expérience des moteurs de recherche et bases vectorielles : OpenSearch, Elasticsearch, Qdrant, Weaviate ou équivalents ;
  • Connaissance d’un framework RAG : LangChain, LlamaIndex ou équivalent ;
  • Maîtrise des API REST et des formats JSON, Parquet et CSV ;
  • Pratique de Git, GitLab CI/CD et Docker ; Kubernetes est un atout.

Sécurité

Connaissance des principes de protection, de traçabilité et de gestion des accès aux données. Une connaissance des exigences de sécurité applicables aux administrations publiques est appréciée.

  • Savoir- faire :Intégrer et fiabiliser des sources de données hétérogènes. Analyser et optimiser les performances des pipelines et des systèmes d’indexation ;

  • Savoir-être:Rigueur, esprit d’analyse, autonomie, curiosité, force de proposition, sens du collectif et capacité à vulgariser., Machine learning Force de proposition Intelligence artificielle API Implémentation de moteurs de recherche SQL Gestion des données Git Kubernetes Python Autonomie Gouvernance des données Gestion des connaissances Bases documentaires JSON API REST Docker Esprit d’analyse

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.hellowork.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

1:34 min

Bringing diverse skills to industrial data science roles

Katja Träumner

6:21 min

Investigating push inefficiencies with upstream Git experts

Jonathan Creamer · Coffee With Developers

3:47 min

Exploring JSON, CBOR, and JOSE for data serialization

Aaron Russell · LIVE

2:07 min

Inspecting default bridge architectures and custom Docker networks

Oliver Seitz Oliver Seitz · World Congress 2025

3:09 min

Balancing data science skillings alongside systems engineering rigor

Nico Schmidt · LIVE

56 sec

Favorite git commands and the importance of patch commits

Eileen Uchitelle Eileen Uchitelle +1 · Coffee With Developers

Videos

See all

Related articles

See all