Data Engineer IA - H/F
- Discuss this with your agent
- Open in Claude
- Open in ChatGPT
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Role details
Tech stack
+17 more
Job description
Bâtis les pipelines de données massives et alimente les moteurs de l’IA générative
Dans le cadre du développement et du passage à l’échelle des cas d’usage IA d’un grand compte, nous recherchons un(e) Data Engineer IA. Ton rôle sera hautement structurant et central : tu concevras, développeras et industrialiseras les pipelines de données volumineux et temps réel qui alimentent les modèles de Machine Learning et les applications d’IA générative, en garantissant la qualité, la traçabilité et la performance des flux de données., Tu évolueras au sein d’une équipe pluridisciplinaire réunissant data engineers, data scientists, architectes data et ingénieurs MLOps. En prise directe avec les équipes plateformes et les squads de développement GenAI, tu travailleras sur des architectures Lakehouse modernes en environnement Cloud. C’est le cadre idéal pour manipuler des volumes de données massifs, mettre en œuvre des flux événementiels temps réel et concevoir des pipelines avancés de préparation documentaire (chunking, vectorisation) pour les architectures RAG.
Tes missions clés
Conception & Développement des Pipelines de Données (Mode BUILD) :
- Concevoir, développer et automatiser des pipelines ETL/ELT robustes depuis des sources hétérogènes (APIs, bases relationnelles, flux événementiels) en modes batch (Spark, PySpark, Databricks, dbt) et temps réel (Kafka).
- Structurer, nettoyer et enrichir les jeux de données destinés à l’entraînement des modèles de Machine Learning et au feature engineering.
- Construire les chaînes de préparation de données textuelles et multimodales pour les architectures RAG : ingestion documentaire automatisée, stratégies de découpage (chunking) et pipelines d’embedding/vectorisation.
- Alimenter, optimiser et administrer les bases de données vectorielles du groupe.
- Mettre en œuvre les architectures de stockage modernes (Delta Lake / Lakehouse, Snowflake, BigQuery).
Industrialisation, Qualité & Optimisation (Mode RUN & MLOps) :
- Industrialiser l’orchestration des flux de données via des outils dédiés (Airflow) en garantissant la sécurité, la haute disponibilité et la reproductibilité du code (Git, CI/CD).
- Optimiser les performances de traitement et piloter les coûts de calcul et de stockage dans le Cloud.
- Garantir la qualité, la gouvernance, la sécurité et la traçabilité (data lineage) des données manipulées.
- Rédiger la documentation technique des pipelines et contribuer activement à l’amélioration des standards d’ingénierie de l’équipe.
Requirements
- Formation : Diplôme d’Ingénieur ou Bac+5 universitaire en informatique, Data Engineering, génie logiciel ou systèmes d’information.
- Expérience : Tu justifies d’une expérience confirmée de 3 à 5 ans en Data Engineering en environnement Cloud, avec idéalement une première mise en pratique sur des cas d’usage IA/ML ou GenAI (pipelines RAG, feature engineering).
- Expertise Data Engineering Impérative :
- Excellente maîtrise de la programmation en Python et des requêtes complexes en SQL.
- Solide expérience de traitement distribué avec Spark / PySpark et de l’environnement Databricks.
- Maîtrise des outils d’orchestration de flux (Airflow) et de transformation de données (dbt).
- Pratique confirmée d’un entrepôt de données moderne (Snowflake, BigQuery, Delta Lake).
- Culture Cloud & IA :
- Expérience sur au moins une plateforme Cloud majeure (Azure, AWS ou GCP).
- Compréhension des flux streaming (Kafka) et des pratiques DevOps (Git, CI/CD).
- Notions ou expérience pratique des architectures RAG et de la manipulation de bases vectorielles.
- Langues : Anglais professionnel opérationnel.
Tes atouts
- Rigueur d’Ingénierie Logicielle : Attachement fort aux bonnes pratiques de développement (code propre, testé, versionné et reproductible).
- Sens de la Qualité et de la Sécurité : Souci permanent de l’intégrité, de la gouvernance et de la confidentialité des données traitées.
- Collaboration Transverse : Capacité naturelle à dialoguer avec les data scientists pour traduire leurs besoins algorithmiques en pipelines scalables.
About the company
Storm Group est un cabinet de conseil en transformation des Systèmes d’Information et des Organisations. Nous intervenons sur l’ensemble de la chaîne de valeur : cadrage personnalisé, pilotage et développement applicatif pour les projets IT critiques.
Apply for this position
This job is hosted externally. Click below to view the full posting and apply.
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Good distractions
Talks and stories from around this role — technically off-topic, practically not.
Moments
Explore playlistsVideos
See allRelated articles
See all
How to Become an AI Engineer
The 12 Best Jobs for Software Engineers
Top-Paying Tech Jobs (with Salaries)
The Most Popular IT Jobs on the Market