Data Engineer IA - H/F

STORM GROUP
Paris, France
8 days ago
Apply on dogfinance.com
Prepare application

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience level
Experienced
Experience required
3 years minimum
Working hours
Regular working hours
Languages
English
Job source

Tech stack

Application Programming Interfaces (APIs) Airflow Amazon Web Services Microsoft Azure BigQuery Cloud Computing Information Systems Continuous Integration Information Engineering Extract Transform Load (ETL) Data Warehousing DevOps
+17 more
Python (Programming Language) Machine Learning Software Engineering SQL Databases Data Streaming Google Cloud Feature Engineering Snowflake Apache Spark Generative AI Git Data Lakes Pyspark Data Lineage Apache Kafka Machine Learning Operations Databricks

Job description

Bâtis les pipelines de données massives et alimente les moteurs de l’IA générative

Dans le cadre du développement et du passage à l’échelle des cas d’usage IA d’un grand compte, nous recherchons un(e) Data Engineer IA. Ton rôle sera hautement structurant et central : tu concevras, développeras et industrialiseras les pipelines de données volumineux et temps réel qui alimentent les modèles de Machine Learning et les applications d’IA générative, en garantissant la qualité, la traçabilité et la performance des flux de données., Tu évolueras au sein d’une équipe pluridisciplinaire réunissant data engineers, data scientists, architectes data et ingénieurs MLOps. En prise directe avec les équipes plateformes et les squads de développement GenAI, tu travailleras sur des architectures Lakehouse modernes en environnement Cloud. C’est le cadre idéal pour manipuler des volumes de données massifs, mettre en œuvre des flux événementiels temps réel et concevoir des pipelines avancés de préparation documentaire (chunking, vectorisation) pour les architectures RAG.

Tes missions clés

Conception & Développement des Pipelines de Données (Mode BUILD) :

  • Concevoir, développer et automatiser des pipelines ETL/ELT robustes depuis des sources hétérogènes (APIs, bases relationnelles, flux événementiels) en modes batch (Spark, PySpark, Databricks, dbt) et temps réel (Kafka).
  • Structurer, nettoyer et enrichir les jeux de données destinés à l’entraînement des modèles de Machine Learning et au feature engineering.
  • Construire les chaînes de préparation de données textuelles et multimodales pour les architectures RAG : ingestion documentaire automatisée, stratégies de découpage (chunking) et pipelines d’embedding/vectorisation.
  • Alimenter, optimiser et administrer les bases de données vectorielles du groupe.
  • Mettre en Å“uvre les architectures de stockage modernes (Delta Lake / Lakehouse, Snowflake, BigQuery).

Industrialisation, Qualité & Optimisation (Mode RUN & MLOps) :

  • Industrialiser l’orchestration des flux de données via des outils dédiés (Airflow) en garantissant la sécurité, la haute disponibilité et la reproductibilité du code (Git, CI/CD).
  • Optimiser les performances de traitement et piloter les coûts de calcul et de stockage dans le Cloud.
  • Garantir la qualité, la gouvernance, la sécurité et la traçabilité (data lineage) des données manipulées.
  • Rédiger la documentation technique des pipelines et contribuer activement à l’amélioration des standards d’ingénierie de l’équipe.

Requirements

  • Formation : Diplôme d’Ingénieur ou Bac+5 universitaire en informatique, Data Engineering, génie logiciel ou systèmes d’information.
  • Expérience : Tu justifies d’une expérience confirmée de 3 à 5 ans en Data Engineering en environnement Cloud, avec idéalement une première mise en pratique sur des cas d’usage IA/ML ou GenAI (pipelines RAG, feature engineering).
  • Expertise Data Engineering Impérative :
  • Excellente maîtrise de la programmation en Python et des requêtes complexes en SQL.
  • Solide expérience de traitement distribué avec Spark / PySpark et de l’environnement Databricks.
  • Maîtrise des outils d’orchestration de flux (Airflow) et de transformation de données (dbt).
  • Pratique confirmée d’un entrepôt de données moderne (Snowflake, BigQuery, Delta Lake).
  • Culture Cloud & IA :
  • Expérience sur au moins une plateforme Cloud majeure (Azure, AWS ou GCP).
  • Compréhension des flux streaming (Kafka) et des pratiques DevOps (Git, CI/CD).
  • Notions ou expérience pratique des architectures RAG et de la manipulation de bases vectorielles.
  • Langues : Anglais professionnel opérationnel.

Tes atouts

  • Rigueur d’Ingénierie Logicielle : Attachement fort aux bonnes pratiques de développement (code propre, testé, versionné et reproductible).
  • Sens de la Qualité et de la Sécurité : Souci permanent de l’intégrité, de la gouvernance et de la confidentialité des données traitées.
  • Collaboration Transverse : Capacité naturelle à dialoguer avec les data scientists pour traduire leurs besoins algorithmiques en pipelines scalables.

About the company

Storm Group est un cabinet de conseil en transformation des Systèmes d’Information et des Organisations. Nous intervenons sur l’ensemble de la chaîne de valeur : cadrage personnalisé, pilotage et développement applicatif pour les projets IT critiques.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on dogfinance.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

6:21 min

Investigating push inefficiencies with upstream Git experts

Jonathan Creamer · Coffee With Developers

2:17 min

Mapping the maturity roadmap for scaled devops adoption

Dominik Krichbaum Dominik Krichbaum · World Congress 2026 Europe

2:15 min

Empowering domain teams with an open data platform

Sandhya Menon Sandhya Menon · World Congress 2026 Europe

3:09 min

Balancing data science skillings alongside systems engineering rigor

Nico Schmidt · LIVE

56 sec

Favorite git commands and the importance of patch commits

Eileen Uchitelle Eileen Uchitelle +1 · Coffee With Developers

2:57 min

Core technical practices for robust data engineering

Sandhya Menon Sandhya Menon · World Congress 2026 Europe

Videos

See all

Related articles

See all