> Markdown version of [/jobs/ext/2671541-data-engineer-ia-h-f](https://www.wearedevelopers.com/jobs/ext/2671541-data-engineer-ia-h-f). Every page supports `.md` or `Accept: text/markdown`. Links point to the HTML versions so they work for humans too. Agent guide: [/agents.md](https://www.wearedevelopers.com/agents.md). --- # Data Engineer IA - H/F - **Company:** STORM GROUP - **Location:** Paris, France - **Experience:** Experienced - **Contract:** Permanent contract - **Skills:** Application Programming Interfaces (APIs), Airflow, Amazon Web Services, Microsoft Azure, BigQuery, Cloud Computing, Information Systems, Continuous Integration, Information Engineering, Extract Transform Load (ETL), Data Warehousing, DevOps, Python (Programming Language), Machine Learning, Software Engineering, SQL Databases, Data Streaming, Google Cloud, Feature Engineering, Snowflake, Apache Spark, Generative AI, Git, Data Lakes, Pyspark, Data Lineage, Apache Kafka, Machine Learning Operations, Databricks - **Published:** September 1, 2026 - **Apply:** https://dogfinance.com/en/offre/storm-group/data-engineer-ia-hf16740 ## About the Role * Formation : Diplôme d'Ingénieur ou Bac+5 universitaire en informatique, Data Engineering, génie logiciel ou systèmes d'information. * Expérience : Tu justifies d'une expérience confirmée de 3 à 5 ans en Data Engineering en environnement Cloud, avec idéalement une première mise en pratique sur des cas d'usage IA/ML ou GenAI (pipelines RAG, feature engineering). * Expertise Data Engineering Impérative : + Excellente maîtrise de la programmation en Python et des requêtes complexes en SQL. + Solide expérience de traitement distribué avec Spark / PySpark et de l'environnement Databricks. + Maîtrise des outils d'orchestration de flux (Airflow) et de transformation de données (dbt). + Pratique confirmée d'un entrepôt de données moderne (Snowflake, BigQuery, Delta Lake). * Culture Cloud & IA : + Expérience sur au moins une plateforme Cloud majeure (Azure, AWS ou GCP). + Compréhension des flux streaming (Kafka) et des pratiques DevOps (Git, CI/CD). + Notions ou expérience pratique des architectures RAG et de la manipulation de bases vectorielles. * Langues : Anglais professionnel opérationnel. Tes atouts * Rigueur d'Ingénierie Logicielle : Attachement fort aux bonnes pratiques de développement (code propre, testé, versionné et reproductible). * Sens de la Qualité et de la Sécurité : Souci permanent de l'intégrité, de la gouvernance et de la confidentialité des données traitées. * Collaboration Transverse : Capacité naturelle à dialoguer avec les data scientists pour traduire leurs besoins algorithmiques en pipelines scalables. ## Description Bâtis les pipelines de données massives et alimente les moteurs de l'IA générative Dans le cadre du développement et du passage à l'échelle des cas d'usage IA d'un grand compte, nous recherchons un(e) Data Engineer IA. Ton rôle sera hautement structurant et central : tu concevras, développeras et industrialiseras les pipelines de données volumineux et temps réel qui alimentent les modèles de Machine Learning et les applications d'IA générative, en garantissant la qualité, la traçabilité et la performance des flux de données., Tu évolueras au sein d'une équipe pluridisciplinaire réunissant data engineers, data scientists, architectes data et ingénieurs MLOps. En prise directe avec les équipes plateformes et les squads de développement GenAI, tu travailleras sur des architectures Lakehouse modernes en environnement Cloud. C'est le cadre idéal pour manipuler des volumes de données massifs, mettre en œuvre des flux événementiels temps réel et concevoir des pipelines avancés de préparation documentaire (chunking, vectorisation) pour les architectures RAG. Tes missions clés Conception & Développement des Pipelines de Données (Mode BUILD) : * Concevoir, développer et automatiser des pipelines ETL/ELT robustes depuis des sources hétérogènes (APIs, bases relationnelles, flux événementiels) en modes batch (Spark, PySpark, Databricks, dbt) et temps réel (Kafka). * Structurer, nettoyer et enrichir les jeux de données destinés à l'entraînement des modèles de Machine Learning et au feature engineering. * Construire les chaînes de préparation de données textuelles et multimodales pour les architectures RAG : ingestion documentaire automatisée, stratégies de découpage (chunking) et pipelines d'embedding/vectorisation. * Alimenter, optimiser et administrer les bases de données vectorielles du groupe. * Mettre en œuvre les architectures de stockage modernes (Delta Lake / Lakehouse, Snowflake, BigQuery). Industrialisation, Qualité & Optimisation (Mode RUN & MLOps) : * Industrialiser l'orchestration des flux de données via des outils dédiés (Airflow) en garantissant la sécurité, la haute disponibilité et la reproductibilité du code (Git, CI/CD). * Optimiser les performances de traitement et piloter les coûts de calcul et de stockage dans le Cloud. * Garantir la qualité, la gouvernance, la sécurité et la traçabilité (data lineage) des données manipulées. * Rédiger la documentation technique des pipelines et contribuer activement à l'amélioration des standards d'ingénierie de l'équipe. ## Related Videos - [From Messy Queries to Scalable Systems - How Data Engineering actually works](https://www.wearedevelopers.com/videos/100203-from-messy-queries-to-scalable-systems-how-data-engineering-actually-works) - [From DevOps to Scaled DevOps: How We’re Rebuilding Continuous Delivery as a Platform](https://www.wearedevelopers.com/videos/100018-from-devops-to-scaled-devops-how-we-re-rebuilding-continuous-delivery-as-a-platform) - [How a Small Team Shrank a Microsoft Monorepo by 94%](https://www.wearedevelopers.com/videos/1236-how-a-small-team-shrank-a-microsoft-monorepo-by-94) - [Enjoying SQL data pipelines with dbt](https://www.wearedevelopers.com/videos/823-enjoying-sql-data-pipelines-with-dbt) - [AI Model Management Life Circles: ML Ops For Generative AI Models From Research to Deployment](https://www.wearedevelopers.com/videos/1152-ai-model-management-life-circles-ml-ops-for-generative-ai-models-from-research-to-deployment) - [DevOps Maturity Check – a way to balance autonomy and alignment](https://www.wearedevelopers.com/videos/58-devops-maturity-check-a-way-to-balance-autonomy-and-alignment) ## Related Articles - [Data Engineer Salary UK](https://www.wearedevelopers.com/magazine/253-data-engineer-salary-uk) - [How to Become an AI Engineer](https://www.wearedevelopers.com/magazine/331-how-to-become-an-ai-engineer) - [The 12 Best Jobs for Software Engineers](https://www.wearedevelopers.com/magazine/401-the-12-best-jobs-for-software-engineers) - [Top-Paying Tech Jobs (with Salaries)](https://www.wearedevelopers.com/magazine/372-top-paying-tech-jobs-with-salaries) - [The Most Popular IT Jobs on the Market](https://www.wearedevelopers.com/magazine/376-the-most-popular-it-jobs-on-the-market) - [Where To Find Software Engineering Jobs](https://www.wearedevelopers.com/magazine/396-where-to-find-software-engineering-jobs)