Data Engineer Databricks Lyon H/F

Groupe Delta
Lyon, France
23 days ago
Apply on www.hellowork.com
Prepare application

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience level
Experienced
Experience required
3 years minimum
Compensation
€42,000.0 - €50,000.0
Working hours
Regular working hours

Tech stack

Automation of Tests Unit Testing Big Data Cloud Computing Software Quality Code Review Apache Hive Python (Programming Language) Software Engineering SQL Databases Strategies of Testing Management of Software Versions
+8 more
Data Ingestion Apache Spark Git Pytest Data Lakes Pyspark Integration Tests Databricks

Job description

En tant que Data Engineer, vous intervenez sur la conception, le développement et l’optimisation de pipelines de données robustes et scalables. Vous travaillez au coeur des plateformes Data afin de garantir la qualité, la disponibilité et la performance des données utilisées par les équipes métiers, BI et Data Science., Concevoir, développer et optimiser des pipelines de données robustes et scalables

  • Collaborer efficacement au sein d’équipes agiles et pluridisciplinaires, en lien avec les équipes Data, IT et métiers
  • Garantir la qualité, la disponibilité et la performance des données
  • Prioriser les tâches, gérer les contraintes et respecter les engagements
  • Communiquer clairement avec des interlocuteurs techniques et non techniques
  • Appliquer les bonnes pratiques de développement logiciel pour assurer la maintenabilité et la testabilité des pipelines
  • Concevoir des pipelines Data comme de véritables produits logiciels, en tenant compte de la maintenabilité, de l’évolutivité et de l’observabilité
  • Mettre en place des stratégies de tests automatisés pour les pipelines, incluant tests unitaires et contrôles de qualité des données

Outils & Environnement

  • Plateforme Databricks dans un contexte Data Engineering
  • Apache Spark via PySpark et Spark SQL pour le développement de pipelines Data
  • Delta Lake et ses mécanismes clés (Delta log, ACID, schema evolution, time travel)
  • Méthodes d’ingestion de données sur la plateforme Databricks
  • Framework Spark Declarative Pipelines
  • Outils de tests automatisés : pytest, contrôles qualité des données (DQX, SDP Expectations)
  • Gestion de version avec Git et workflows collaboratifs associés
  • Langage SQL pour interrogation des données
  • Programmation en Python avec bonnes pratiques de software engineering (structuration, modularité, conventions de nommage, gestion des dépendances)
  • Environnements Business Intelligence, Big Data et architectures Lakehouse
  • Plateformes Data modernes (Cloud), 11. Bagage en software engineering pour écrire un code robuste, lisible, maintenable et testable, notamment en Python 12. Application des bonnes pratiques de développement : structuration du code, modularité, gestion des dépendances, conventions de nommage 13. Sensibilisation aux principes de qualité logicielle (tests unitaires, tests d’intégration, revue de code) 14. À l’aise avec les outils de versioning (Git) et workflows collaboratifs 15. Capacité à concevoir des pipelines Data comme des produits logiciels, en tenant compte de la maintenabilité, évolutivité et observabilité 16. Bonne maîtrise de la plateforme Databricks en contexte Data Engineering 17. Utilisation avancée d’Apache Spark via PySpark et Spark SQL pour le développement de pipelines Data 18. Connaissance de Delta Lake et de ses mécanismes clés (Delta log, ACID, schema evolution, time travel) 19. Maîtrise des différentes méthodes d’ingestion de données de la plateforme 20. Connaissance et implémentation du framework Spark Declarative Pipelines 21. Mise en place de stratégies de tests automatisés pour les pipelines incluant : tests unitaires (ex. pytest), contrôles de qualité des données (DQX, SDP Expectations) 22. Certification recommandée : Databricks Certified Data Engineer Associate (ou équivalent)

Requirements

Profil recherché3 à 8+ ans d’expérience en ingénierie DataCapacité à évoluer efficacement au sein d’équipes agiles et pluridisciplinairesFort esprit analytique et grande rigueurAutonomie, proactivité et sens des responsabilitésCapacité à communiquer clairement avec des interlocuteurs techniques et non techniquesSavoir prioriser les tâches, gérer les contraintes et respecter les engagementsEsprit de synthèse et orientation résultats et valeur métierBonne connaissance des environnements Business Intelligence, Big Data et des architectures LakehouseExpérience sur des plateformes Data modernes (Cloud)Maîtrise de SQL et notions de modélisation de données (architecture médaillon, modèle en étoile)Bagage en software engineering pour écrire un code robuste, lisible, maintenable et testable, notamment en PythonApplication des bonnes pratiques de développement : structuration du code, modularité, gestion des dépendances, conventions de nommageSensibilisation aux principes de qualité logicielle (tests unitaires, tests d’intégration, revue de code)À l’aise avec les outils de versioning (Git) et workflows collaboratifsCapacité à concevoir des pipelines Data comme des produits logiciels, en tenant compte de la maintenabilité, évolutivité et observabilitéBonne maîtrise de la plateforme Databricks en contexte Data EngineeringUtilisation avancée d’Apache Spark via PySpark et Spark SQL pour le développement de pipelines DataConnaissance de Delta Lake et de ses mécanismes clés (Delta log, ACID, schema evolution, time travel)Maîtrise des différentes méthodes d’ingestion de données de la plateformeConnaissance et implémentation du framework Spark Declarative PipelinesMise en place de stratégies de tests automatisés pour les pipelines incluant : tests unitaires (ex. pytest), contrôles de qualité des données (DQX, SDP Expectations)Certification recommandée : Databricks Certified Data Engineer Associate (ou équivalent), 1. 3 à 8+ ans d’expérience en ingénierie Data

  1. Capacité à évoluer efficacement au sein d’équipes agiles et pluridisciplinaires
  2. Fort esprit analytique et grande rigueur
  3. Autonomie, proactivité et sens des responsabilités
  4. Capacité à communiquer clairement avec des interlocuteurs techniques et non techniques
  5. Savoir prioriser les tâches, gérer les contraintes et respecter les engagements
  6. Esprit de synthèse et orientation résultats et valeur métier
  7. Bonne connaissance des environnements Business Intelligence, Big Data et des architectures Lakehouse
  8. Expérience sur des plateformes Data modernes (Cloud)
  9. Maîtrise de SQL et notions de modélisation de données (architecture médaillon, modèle en étoile), Apache spark Business Intelligence Contrôle qualité SQL Modélisation des données Git Développement logiciel Pro-activité Big data Python Autonomie Esprit d’analyse

Benefits & conditions

Expérience attendue : 3 à 8+ ans en ingénierie Data

  • Rémunération : 42-50K€
  • Certifications recommandées, Databricks Certified Data Engineer Associate (ou équivalent)

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.hellowork.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

6:21 min

Investigating push inefficiencies with upstream Git experts

Jonathan Creamer · Coffee With Developers

5:30 min

Extending testing workflows using popular pytest plugins

Florian Bruhin · World Congress 2021

4:32 min

Harnessing Spark with Python using PySpark and Py4J

Ayon Roy · LIVE

3:09 min

Balancing data science skillings alongside systems engineering rigor

Nico Schmidt · LIVE

3:37 min

Scaling machine learning pipelines from prototypes to petabytes

Julian Joseph · LIVE

3:05 min

Tagging and organizing execution scenarios with pytest markers

Florian Bruhin · World Congress 2021

Videos

See all

Related articles

See all