Data Product Engineer H/F
- Discuss this with your agent
- Open in Claude
- Open in ChatGPT
Role details
Tech stack
+19 more
Job description
Dans le cadre de la transition vers une architecture Data Mesh, nous recherchons un(e) Data Product Engineer spécialisé(e) dans le développement de pipelines sur la plateforme Talend Real Time BigData et de data products sur la plateforme Starburst (Trino). La mission consiste à concevoir, collecter, intégrer, construire et opérer des jeux de données fiables, auto-descriptifs et interopérables, en collaboration avec les domain teams et les data owners., Concevoir des flux de données et des Data Products
- DĂ©velopper des pipelines dâintĂ©gration de donnĂ©es optimisĂ©s via la Talend Data Fabric / Talend Real Time BigData
- DĂ©velopper des requĂȘtes SQL optimisĂ©es pour Starburst/Trino (push-down predicates, partitionnement, formats de fichiers comme Iceberg/Parquet)
- Automatiser les pipelines de données (ETL/ELT) avec des outils comme Airflow, dbt, ou Starburst Galaxy
- Configurer des accÚs sécurisés (RBAC, row-level security) et des politiques de gouvernance (tagging, lineage)
- Collaborer avec les domain teams pour identifier les sources de donnĂ©es et les cas dâusage
- Documenter les data products (métadonnées, ownership, qualité) via des outils comme Amundsen, DataHub, ou Starburst Discover
- Participer Ă la dĂ©finition des standards dâinteropĂ©rabilitĂ© (formats communs, APIs de donnĂ©es)
- Monitorer la performance (latence, coĂ»t des requĂȘtes) et la qualitĂ© des donnĂ©es (frais, complĂ©tude)
- Mettre en place des alertes et des dashboards (Grafana, Metabase) pour le suivi des data products
- Contribuer Ă lâamĂ©lioration continue de la plateforme Starburst (scaling, caching, federation)
Requirements
Talend RealTime BigData : expérience avancée en développement de pipelines sur Talend Studio en mode batch ou route (runtime)
- Starburst/Trino : expérience avancée en SQL sur Starburst/Trino (jointures, CTEs, fonctions analytiques)
- Data Modeling
- Pipelines : expérience avec Airflow/Astronomer, Spark, Talend Real Time Big Data / Talend Data intégration
- Stockage : connaissance des formats Iceberg, Parquet, S3
- Gouvernance : familiarité avec les outils de sécurité (Ranger, RBAC)
- DevOps/DataOps : pratiques CI/CD pour les pipelines, infrastructure-as-code (Terraform, Kubernetes)
- Langages : SQL avancé (mandatory), Python (Pandas, PySpark), bash
Compétences transverses (Data Mesh)
- Compréhension des principes Data Mesh (domain-oriented ownership, self-serve platform, federated governance)
- Capacité à travailler en mode produit (roadmap, priorisation, collaboration avec les métiers)
- Sensibilité à la data quality (tests, monitoring, remédiation) et à la documentation (data contracts, métadonnées)
Soft Skills
- Esprit collaboratif : travail avec les équipes métiers, data scientists, et DevOps
- Pédagogie : capacité à expliquer des concepts techniques à des non-experts
- Autonomie : prise dâinitiative dans un cadre agile
Environnement technique
- Expertise écosystÚme zoo Hadoop
- Connaissance / maĂźtrise Data
- Connaissance / maĂźtrise technique de lâenvironnement DevOps
- MaĂźtrise technique de lâenvironnement Data
- Expertise couche dâaccĂšs et dĂ©change (Kafka, Nifi, âŠ)
- Expertise Java, Scala, Python, Hive, Spark
- Expertise ETL, Bash
-
Expertise SQL / NoSQL, Profil recherchĂ©ExpĂ©rience avancĂ©e en dĂ©veloppement de pipelines sur Talend RealTime BigData (Talend Studio en mode batch ou route)ExpĂ©rience avancĂ©e en SQL sur Starburst/Trino (jointures, CTEs, fonctions analytiques)ExpĂ©rience avec Airflow/Astronomer, Spark, Talend Data intĂ©grationConnaissance des formats de stockage Iceberg, Parquet, S3FamiliaritĂ© avec les outils de sĂ©curitĂ© et gouvernance (Ranger, RBAC)Pratiques CI/CD pour les pipelines, infrastructure-as-code (Terraform, Kubernetes)MaĂźtrise des langages : SQL avancĂ© (obligatoire), Python (Pandas, PySpark), bashComprĂ©hension des principes Data Mesh (domain-oriented ownership, self-serve platform, federated governance)CapacitĂ© Ă travailler en mode produit (roadmap, priorisation, collaboration avec les mĂ©tiers)SensibilitĂ© Ă la data quality (tests, monitoring, remĂ©diation) et Ă la documentation (data contracts, mĂ©tadonnĂ©es)Esprit collaboratif : travail avec les Ă©quipes mĂ©tiers, data scientists, et DevOpsPĂ©dagogie : capacitĂ© Ă expliquer des concepts techniques Ă des non-expertsAutonomie : prise dâinitiative dans un cadre agileExpertise dans lâĂ©cosystĂšme HadoopMaĂźtrise technique de lâenvironnement Data et DevOpsExpertise sur les couches dâaccĂšs et dâĂ©change (Kafka, Nifi)Expertise en langages Java, Scala, Python, Hive, SparkExpertise en ETL, BashExpertise en SQL / NO SQL, * ExpĂ©rience avancĂ©e en dĂ©veloppement de pipelines sur Talend RealTime BigData (Talend Studio en mode batch ou route)
- Expérience avancée en SQL sur Starburst/Trino (jointures, CTEs, fonctions analytiques)
- Expérience avec Airflow/Astronomer, Spark, Talend Data intégration
- Connaissance des formats de stockage Iceberg, Parquet, S3
- Familiarité avec les outils de sécurité et gouvernance (Ranger, RBAC)
- Pratiques CI/CD pour les pipelines, infrastructure-as-code (Terraform, Kubernetes)
- Maßtrise des langages : SQL avancé (obligatoire), Python (Pandas, PySpark), bash
- Compréhension des principes Data Mesh (domain-oriented ownership, self-serve platform, federated governance)
- Capacité à travailler en mode produit (roadmap, priorisation, collaboration avec les métiers)
- Sensibilité à la data quality (tests, monitoring, remédiation) et à la documentation (data contracts, métadonnées)
- Esprit collaboratif : travail avec les équipes métiers, data scientists, et DevOps
- Pédagogie : capacité à expliquer des concepts techniques à des non-experts
- Autonomie : prise dâinitiative dans un cadre agile
- Expertise dans lâĂ©cosystĂšme Hadoop
- MaĂźtrise technique de lâenvironnement Data et DevOps
- Expertise sur les couches dâaccĂšs et dâĂ©change (Kafka, Nifi)
- Expertise en langages Java, Scala, Python, Hive, Spark
- Expertise en ETL, Bash
- Expertise en SQL / NO SQL
EUR
Bash ETL Scala Pédagogie Hadoop SQL Hive Pro-activité Kubernetes Big data Python Autonomie KAFKA Java NoSQL
Apply for this position
This job is hosted externally. Click below to view the full posting and apply.
Apply on www.hellowork.comGood distractions
Talks and stories from around this role â technically off-topic, practically not.
Moments
Explore playlistsVideos
See allRelated articles
See all
Data Engineer Salary UK
Highest Paying Tech Companies for Developers
Résumé-Driven Development: How IT trends affect the job market for software developers
Best Coding Boot Camps in Germany