Data Product Engineer H/F

Visian
Paris, France
4 days ago

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours

Tech stack

Java (Programming Language) Application Programming Interfaces (APIs) Airflow Amazon S3 Bash Shell Big Data Continuous Integration Data Integration Extract Transform Load (ETL) DevOps Apache Hadoop Apache Hive
+19 more
Python (Programming Language) NoSQL Role-Based Access Control DataOps Scala (Programming Language) SQL Databases Data Streaming Talend Parquet Grafana Apache Spark Analytic Functions Caching Pandas Pyspark Kubernetes Apache Kafka Apache Nifi Terraform

Job description

Dans le cadre de la transition vers une architecture Data Mesh, nous recherchons un(e) Data Product Engineer spécialisé(e) dans le développement de pipelines sur la plateforme Talend Real Time BigData et de data products sur la plateforme Starburst (Trino). La mission consiste à concevoir, collecter, intégrer, construire et opérer des jeux de données fiables, auto-descriptifs et interopérables, en collaboration avec les domain teams et les data owners., Concevoir des flux de données et des Data Products

  • DĂ©velopper des pipelines d’intĂ©gration de donnĂ©es optimisĂ©s via la Talend Data Fabric / Talend Real Time BigData
  • DĂ©velopper des requĂȘtes SQL optimisĂ©es pour Starburst/Trino (push-down predicates, partitionnement, formats de fichiers comme Iceberg/Parquet)
  • Automatiser les pipelines de donnĂ©es (ETL/ELT) avec des outils comme Airflow, dbt, ou Starburst Galaxy
  • Configurer des accĂšs sĂ©curisĂ©s (RBAC, row-level security) et des politiques de gouvernance (tagging, lineage)
  • Collaborer avec les domain teams pour identifier les sources de donnĂ©es et les cas d’usage
  • Documenter les data products (mĂ©tadonnĂ©es, ownership, qualitĂ©) via des outils comme Amundsen, DataHub, ou Starburst Discover
  • Participer Ă  la dĂ©finition des standards d’interopĂ©rabilitĂ© (formats communs, APIs de donnĂ©es)
  • Monitorer la performance (latence, coĂ»t des requĂȘtes) et la qualitĂ© des donnĂ©es (frais, complĂ©tude)
  • Mettre en place des alertes et des dashboards (Grafana, Metabase) pour le suivi des data products
  • Contribuer Ă  l’amĂ©lioration continue de la plateforme Starburst (scaling, caching, federation)

Requirements

Talend RealTime BigData : expérience avancée en développement de pipelines sur Talend Studio en mode batch ou route (runtime)

  • Starburst/Trino : expĂ©rience avancĂ©e en SQL sur Starburst/Trino (jointures, CTEs, fonctions analytiques)
  • Data Modeling
  • Pipelines : expĂ©rience avec Airflow/Astronomer, Spark, Talend Real Time Big Data / Talend Data intĂ©gration
  • Stockage : connaissance des formats Iceberg, Parquet, S3
  • Gouvernance : familiaritĂ© avec les outils de sĂ©curitĂ© (Ranger, RBAC)
  • DevOps/DataOps : pratiques CI/CD pour les pipelines, infrastructure-as-code (Terraform, Kubernetes)
  • Langages : SQL avancĂ© (mandatory), Python (Pandas, PySpark), bash

Compétences transverses (Data Mesh)

  • ComprĂ©hension des principes Data Mesh (domain-oriented ownership, self-serve platform, federated governance)
  • CapacitĂ© Ă  travailler en mode produit (roadmap, priorisation, collaboration avec les mĂ©tiers)
  • SensibilitĂ© Ă  la data quality (tests, monitoring, remĂ©diation) et Ă  la documentation (data contracts, mĂ©tadonnĂ©es)

Soft Skills

  • Esprit collaboratif : travail avec les Ă©quipes mĂ©tiers, data scientists, et DevOps
  • PĂ©dagogie : capacitĂ© Ă  expliquer des concepts techniques Ă  des non-experts
  • Autonomie : prise d’initiative dans un cadre agile

Environnement technique

  • Expertise Ă©cosystĂšme zoo Hadoop
  • Connaissance / maĂźtrise Data
  • Connaissance / maĂźtrise technique de l’environnement DevOps
  • MaĂźtrise technique de l’environnement Data
  • Expertise couche d’accĂšs et dĂ©change (Kafka, Nifi, 
)
  • Expertise Java, Scala, Python, Hive, Spark
  • Expertise ETL, Bash
  • Expertise SQL / NoSQL, Profil recherchĂ©ExpĂ©rience avancĂ©e en dĂ©veloppement de pipelines sur Talend RealTime BigData (Talend Studio en mode batch ou route)ExpĂ©rience avancĂ©e en SQL sur Starburst/Trino (jointures, CTEs, fonctions analytiques)ExpĂ©rience avec Airflow/Astronomer, Spark, Talend Data intĂ©grationConnaissance des formats de stockage Iceberg, Parquet, S3FamiliaritĂ© avec les outils de sĂ©curitĂ© et gouvernance (Ranger, RBAC)Pratiques CI/CD pour les pipelines, infrastructure-as-code (Terraform, Kubernetes)MaĂźtrise des langages : SQL avancĂ© (obligatoire), Python (Pandas, PySpark), bashComprĂ©hension des principes Data Mesh (domain-oriented ownership, self-serve platform, federated governance)CapacitĂ© Ă  travailler en mode produit (roadmap, priorisation, collaboration avec les mĂ©tiers)SensibilitĂ© Ă  la data quality (tests, monitoring, remĂ©diation) et Ă  la documentation (data contracts, mĂ©tadonnĂ©es)Esprit collaboratif : travail avec les Ă©quipes mĂ©tiers, data scientists, et DevOpsPĂ©dagogie : capacitĂ© Ă  expliquer des concepts techniques Ă  des non-expertsAutonomie : prise d’initiative dans un cadre agileExpertise dans l’écosystĂšme HadoopMaĂźtrise technique de l’environnement Data et DevOpsExpertise sur les couches d’accĂšs et d’échange (Kafka, Nifi)Expertise en langages Java, Scala, Python, Hive, SparkExpertise en ETL, BashExpertise en SQL / NO SQL, * ExpĂ©rience avancĂ©e en dĂ©veloppement de pipelines sur Talend RealTime BigData (Talend Studio en mode batch ou route)

  • ExpĂ©rience avancĂ©e en SQL sur Starburst/Trino (jointures, CTEs, fonctions analytiques)
  • ExpĂ©rience avec Airflow/Astronomer, Spark, Talend Data intĂ©gration
  • Connaissance des formats de stockage Iceberg, Parquet, S3
  • FamiliaritĂ© avec les outils de sĂ©curitĂ© et gouvernance (Ranger, RBAC)
  • Pratiques CI/CD pour les pipelines, infrastructure-as-code (Terraform, Kubernetes)
  • MaĂźtrise des langages : SQL avancĂ© (obligatoire), Python (Pandas, PySpark), bash
  • ComprĂ©hension des principes Data Mesh (domain-oriented ownership, self-serve platform, federated governance)
  • CapacitĂ© Ă  travailler en mode produit (roadmap, priorisation, collaboration avec les mĂ©tiers)
  • SensibilitĂ© Ă  la data quality (tests, monitoring, remĂ©diation) et Ă  la documentation (data contracts, mĂ©tadonnĂ©es)
  • Esprit collaboratif : travail avec les Ă©quipes mĂ©tiers, data scientists, et DevOps
  • PĂ©dagogie : capacitĂ© Ă  expliquer des concepts techniques Ă  des non-experts
  • Autonomie : prise d’initiative dans un cadre agile
  • Expertise dans l’écosystĂšme Hadoop
  • MaĂźtrise technique de l’environnement Data et DevOps
  • Expertise sur les couches d’accĂšs et d’échange (Kafka, Nifi)
  • Expertise en langages Java, Scala, Python, Hive, Spark
  • Expertise en ETL, Bash
  • Expertise en SQL / NO SQL

EUR

Bash ETL Scala Pédagogie Hadoop SQL Hive Pro-activité Kubernetes Big data Python Autonomie KAFKA Java NoSQL

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.hellowork.com

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

1:34 min

Bringing diverse skills to industrial data science roles

Katja TrÀumner

2:03 min

Accelerating pandas dataframes using cudf module plugins

Ankit Patel Ankit Patel · WWC 2024

2:37 min

Comparing traditional SQL tables versus NoSQL non-tabular databases

Stanimira Vlaeva · JS Congress

3:33 min

Refactoring data science workflows using Rapids QDF and Pandas

Paul Graham Paul Graham · LIVE

2:57 min

Core technical practices for robust data engineering

Sandhya Menon Sandhya Menon · WWC Europe 2026

6:58 min

Analyzing production code coverage data using pandas

Markus Harrer Markus Harrer · WWC 2021

Videos

See all

Related articles

See all