Data Engineer Databricks/AWS

Visian
Paris, France
about 2 months ago
Apply on indeed.com
Prepare application

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours
Job source

Tech stack

Amazon Web Services Data Validation Data Cleansing Python (Programming Language) Raw Data SQL Databases Apache Spark Data Lakes Pyspark Data Management Databricks

Job description

Le Data Engineer supervise et intĂšgre des donnĂ©es de natures diverses provenant de sources multiples ; il vĂ©rifie la qualitĂ© des donnĂ©es entrant dans le Data Lake, en effectuant notamment des tests, la dĂ©duplication et les activitĂ©s d’assurance qualitĂ© associĂ©es.

Les principales responsabilités incluent :

Qualification et gestion des données :

  • Collecte de donnĂ©es structurĂ©es et non structurĂ©es produites par diffĂ©rentes applications ou provenant de sources externes Ă  l’entitĂ©

  • IntĂ©gration des Ă©lĂ©ments

  • Structuration des donnĂ©es (sĂ©mantique, etc.)

  • Cartographie des Ă©lĂ©ments disponibles

  • Nettoyage des donnĂ©es (Ă©limination des doublons, etc.)

  • Validation des donnĂ©es

  • CrĂ©ation Ă©ventuelle du rĂ©fĂ©rentiel de donnĂ©es

La plateforme de données permet à tous les domaines producteurs de données de mettre à disposition des données brutes ou retravaillées dans un Data Lake. Cette plateforme gÚre notamment les fonctionnalités et les données relevant du périmÚtre métier « Relation Réseau ». Elle permet :

  • L’intĂ©gration et l’assurance qualitĂ© des donnĂ©es brutes reçues des distributeurs

  • La mise Ă  disposition de donnĂ©es GRD exploitables pour tous les besoins du segment et de l’organisation (qu’il s’agisse de besoins opĂ©rationnels ou analytiques issus de tous les domaines mĂ©tiers), * MaĂźtrise des outils Databricks (crĂ©ation de jobs, clusters, notebooks) et capacitĂ© Ă  effectuer des requĂȘtes SQL efficaces

  • Maintien en conditions opĂ©rationnelles de la plateforme de production (analyse et correction d’incidents et d’anomalies)

  • DĂ©veloppement de jobs d’ingestion et de transformation de donnĂ©es en Python avec Spark pour traiter de grands volumes de donnĂ©es

  • Apport d’une vision Ă  long terme, tant sur le plan opĂ©rationnel que stratĂ©gique pour la plateforme de donnĂ©es

  • Soutien et promotion des meilleures pratiques

  • Participation aux ateliers de conception technique et fonctionnelle

  • RĂ©daction et mise Ă  jour de la documentation technique

Requirements

SQL Niveaux d’expĂ©rience Python V3 ConfirmĂ© Niveaux d’expĂ©rience Pyspark ConfirmĂ© Databricks (unity catalog, workflow, job, notebook) ConfirmĂ© AWS (Lambda, ECS, Step Function) confirmĂ©

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on indeed.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

4:32 min

Harnessing Spark with Python using PySpark and Py4J

Ayon Roy · LIVE

4:09 min

Challenges of interpreting raw data with language models

Clemens Vasters Clemens Vasters · World Congress 2025

3:24 min

The governance failures of centralized data lakes

Mario Meir-Huber · LIVE

1:59 min

Key takeaways and accessing the Databricks developer toolkit

Viktoria Semaan Viktoria Semaan · World Congress 2026 Europe

3:42 min

Building data pipelines and managing machine learning features

Hauke Brammer · World Congress 2021

3:37 min

Scaling machine learning pipelines from prototypes to petabytes

Julian Joseph · LIVE

Videos

See all

Related articles

See all