Data Engineer Databricks TJM max 600

Craftman data
Paris, France
about 1 month ago

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience level
Experienced
Experience required
2 years minimum
Working hours
Regular working hours
Job source

Tech stack

Application Programming Interfaces (APIs) Amazon Web Services Data Analysis Microsoft Azure Cloud Computing Code Review Continuous Integration Data Validation Extract Transform Load (ETL) Github Apache Hive DataOps
+8 more
Data Streaming Google Cloud Git Data Lakes Pyspark Apache Kafka Machine Learning Operations Databricks

Job description

MissionsDéveloppement & Architecture DataConcevoir et développer des pipelines de données sur Databricks (PySpark, Spark SQL, Delta Live Tables).

Mettre en place des architectures Lakehouse basées sur Delta Lake.

Industrialiser les workflows ETL/ELT avec Databricks Workflows.

Administration de la plateforme DatabricksAdministrer les environnements Databricks (workspaces, clusters, permissions).

Optimiser les coûts via la configuration, l’autoscaling et le monitoring des clusters.

Mettre en ?uvre les bonnes pratiques de sécurité (Unity Catalog, gestion des accès, lineage).

Gouvernance & Qualité des donnéesDéployer des mécanismes de contrôle qualité et de validation des données (expectations, tests).

Documenter les modèles de données et les flux.

Garantir la fiabilité, la disponibilité et la fraîcheur des données.

CollaborationCollaborer avec les équipes Data, Analytics, IA et les métiers.

Accompagner les utilisateurs dans l’adoption de la plateforme Databricks.

Participer aux revues de code, à la standardisation des développements et au partage des bonnes pratiques.

Requirements

Do you have experience in Unity?, Compétences techniques requisesExcellente maîtrise de PySpark et/ou Spark SQL.

Expérience significative sur Databricks (pipelines, notebooks, clusters, Unity Catalog).

Bonne connaissance des architectures Lakehouse.

Solides compétences en ETL/ELT, modélisation de données et ingestion batch/streaming.

Expérience sur un environnement Cloud (Azure, AWS ou GCP).

Maîtrise de Git et des outils de CI/CD (Azure DevOps, GitHub Actions ou équivalent).

Compétences appréciéesConnaissances de MLflow et des pratiques MLOps.

Sensibilité aux approches DataOps, à l’optimisation des coûts et au monitoring.

Expérience avec les APIs et les flux temps réel (Kafka ou technologies similaires).

Profil recherchéBac+5 en informatique, data ou équivalent.

2 à 5 ans d’expérience en Data Engineering, avec une expertise sur Databricks.

Esprit d’équipe, autonomie, rigueur, bonnes capacités de communication et goût pour la documentation., Profil recherchéBac+5 en informatique, data ou équivalent.

2 à 5 ans d’expérience en Data Engineering, avec une expertise sur Databricks.

Esprit d’équipe, autonomie, rigueur, bonnes capacités de communication et goût pour la documentation.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on indeed.com

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

3:09 min

Balancing data science skillings alongside systems engineering rigor

Nico Schmidt · LIVE

6:21 min

Investigating push inefficiencies with upstream Git experts

Jonathan Creamer · Coffee With Developers

6:36 min

Funding open source through GitHub Accelerator and Sponsors

Stormy Peters · WWC 2023

4:32 min

Harnessing Spark with Python using PySpark and Py4J

Ayon Roy · LIVE

1:34 min

Bringing diverse skills to industrial data science roles

Katja Träumner

56 sec

Favorite git commands and the importance of patch commits

Eileen Uchitelle Eileen Uchitelle +1 · Coffee With Developers

Videos

See all

Related articles

See all