Data Engineer Modern Data Stack H/F
Role details
Job location
Tech stack
Job description
Concevoir, développer et maintenir des pipelines d'ingestion et de transformation de données (batch et temps réel) en Python et SQL.
-Mettre en oeuvre des Modern Data Platforms sur le cloud (Azure, AWS, GCP) : Data Lake, Data Warehouse, zones raw / cleansed / business.
-Industrialiser les traitements : orchestration, CI/CD, tests, reprise sur erreur, déploiement via IaC.
-Mettre en place les contrôles de qualité de données et l'observabilité associée (fraîcheur, complétude, lineage, alerting).
-Contribuer aux projets liés à la donnée et à l'IA (LLM chatbot, RAG, Azure AI/ML services) en exposant des données fiables et exploitables.
-Optimiser les performances et les coûts des traitements (partitionnement, formats defichiers, dimensionnement, FinOps), y compris sur des architectures hybrides intégrant des environnements on-premise.
Requirements
Expérience : au moins 5 ans sur des projets de data engineering, dont une expérience significative sur la mise en production de pipelines en environnement cloud.
-Python : maîtrise confirmée (code structuré, testé, packagé), ainsi que SQL avancé.
-Intégration & transformation : dbt, Spark / PySpark, Talend, Kafka / Kafka Connect, Nifi, Airbyte ou équivalents - plusieurs outils du marché pratiqués.
-Orchestration : Airflow, Dagster, Prefect, Azure Data Factory.
-Cloud : maîtrise d'au moins une des plateformes (Azure, GCP, AWS) avec une expérience significative sur ses services data (BigQuery, Synapse, Databricks, Snowflake, Redshift...).
-IaC : Terraform, AWS CDK, Bicep.
-CI/CD : GitHub Actions, GitLab CI/CD, Jenkins.
-Data/AI (un plus) : connaissance des plateformes MLOps, services AI/ML cloud, formats et moteurs de table (Parquet, Delta Lake, Iceberg).
-Cloud hybride : expérience des déploiements et intégrations avec des infrastructures on-premise., Contrôle qualité SQL AWS Git Batching Jenkins Python KAFKA