Data Engineer Databricks Lyon H/F
- Discuss this with your agent
- Open in Claude
- Open in ChatGPT
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Role details
Tech stack
+8 more
Job description
En tant que Data Engineer, vous intervenez sur la conception, le développement et l’optimisation de pipelines de données robustes et scalables. Vous travaillez au coeur des plateformes Data afin de garantir la qualité, la disponibilité et la performance des données utilisées par les équipes métiers, BI et Data Science., Concevoir, développer et optimiser des pipelines de données robustes et scalables
- Collaborer efficacement au sein d’équipes agiles et pluridisciplinaires, en lien avec les équipes Data, IT et métiers
- Garantir la qualité, la disponibilité et la performance des données
- Prioriser les tâches, gérer les contraintes et respecter les engagements
- Communiquer clairement avec des interlocuteurs techniques et non techniques
- Appliquer les bonnes pratiques de développement logiciel pour assurer la maintenabilité et la testabilité des pipelines
- Concevoir des pipelines Data comme de véritables produits logiciels, en tenant compte de la maintenabilité, de l’évolutivité et de l’observabilité
- Mettre en place des stratégies de tests automatisés pour les pipelines, incluant tests unitaires et contrôles de qualité des données
Outils & Environnement
- Plateforme Databricks dans un contexte Data Engineering
- Apache Spark via PySpark et Spark SQL pour le développement de pipelines Data
- Delta Lake et ses mécanismes clés (Delta log, ACID, schema evolution, time travel)
- Méthodes d’ingestion de données sur la plateforme Databricks
- Framework Spark Declarative Pipelines
- Outils de tests automatisés : pytest, contrôles qualité des données (DQX, SDP Expectations)
- Gestion de version avec Git et workflows collaboratifs associés
- Langage SQL pour interrogation des données
- Programmation en Python avec bonnes pratiques de software engineering (structuration, modularité, conventions de nommage, gestion des dépendances)
- Environnements Business Intelligence, Big Data et architectures Lakehouse
- Plateformes Data modernes (Cloud), 11. Bagage en software engineering pour écrire un code robuste, lisible, maintenable et testable, notamment en Python 12. Application des bonnes pratiques de développement : structuration du code, modularité, gestion des dépendances, conventions de nommage 13. Sensibilisation aux principes de qualité logicielle (tests unitaires, tests d’intégration, revue de code) 14. À l’aise avec les outils de versioning (Git) et workflows collaboratifs 15. Capacité à concevoir des pipelines Data comme des produits logiciels, en tenant compte de la maintenabilité, évolutivité et observabilité 16. Bonne maîtrise de la plateforme Databricks en contexte Data Engineering 17. Utilisation avancée d’Apache Spark via PySpark et Spark SQL pour le développement de pipelines Data 18. Connaissance de Delta Lake et de ses mécanismes clés (Delta log, ACID, schema evolution, time travel) 19. Maîtrise des différentes méthodes d’ingestion de données de la plateforme 20. Connaissance et implémentation du framework Spark Declarative Pipelines 21. Mise en place de stratégies de tests automatisés pour les pipelines incluant : tests unitaires (ex. pytest), contrôles de qualité des données (DQX, SDP Expectations) 22. Certification recommandée : Databricks Certified Data Engineer Associate (ou équivalent)
Requirements
Profil recherché3 à 8+ ans d’expérience en ingénierie DataCapacité à évoluer efficacement au sein d’équipes agiles et pluridisciplinairesFort esprit analytique et grande rigueurAutonomie, proactivité et sens des responsabilitésCapacité à communiquer clairement avec des interlocuteurs techniques et non techniquesSavoir prioriser les tâches, gérer les contraintes et respecter les engagementsEsprit de synthèse et orientation résultats et valeur métierBonne connaissance des environnements Business Intelligence, Big Data et des architectures LakehouseExpérience sur des plateformes Data modernes (Cloud)Maîtrise de SQL et notions de modélisation de données (architecture médaillon, modèle en étoile)Bagage en software engineering pour écrire un code robuste, lisible, maintenable et testable, notamment en PythonApplication des bonnes pratiques de développement : structuration du code, modularité, gestion des dépendances, conventions de nommageSensibilisation aux principes de qualité logicielle (tests unitaires, tests d’intégration, revue de code)À l’aise avec les outils de versioning (Git) et workflows collaboratifsCapacité à concevoir des pipelines Data comme des produits logiciels, en tenant compte de la maintenabilité, évolutivité et observabilitéBonne maîtrise de la plateforme Databricks en contexte Data EngineeringUtilisation avancée d’Apache Spark via PySpark et Spark SQL pour le développement de pipelines DataConnaissance de Delta Lake et de ses mécanismes clés (Delta log, ACID, schema evolution, time travel)Maîtrise des différentes méthodes d’ingestion de données de la plateformeConnaissance et implémentation du framework Spark Declarative PipelinesMise en place de stratégies de tests automatisés pour les pipelines incluant : tests unitaires (ex. pytest), contrôles de qualité des données (DQX, SDP Expectations)Certification recommandée : Databricks Certified Data Engineer Associate (ou équivalent), 1. 3 à 8+ ans d’expérience en ingénierie Data
- Capacité à évoluer efficacement au sein d’équipes agiles et pluridisciplinaires
- Fort esprit analytique et grande rigueur
- Autonomie, proactivité et sens des responsabilités
- Capacité à communiquer clairement avec des interlocuteurs techniques et non techniques
- Savoir prioriser les tâches, gérer les contraintes et respecter les engagements
- Esprit de synthèse et orientation résultats et valeur métier
- Bonne connaissance des environnements Business Intelligence, Big Data et des architectures Lakehouse
- Expérience sur des plateformes Data modernes (Cloud)
- Maîtrise de SQL et notions de modélisation de données (architecture médaillon, modèle en étoile), Apache spark Business Intelligence Contrôle qualité SQL Modélisation des données Git Développement logiciel Pro-activité Big data Python Autonomie Esprit d’analyse
Benefits & conditions
Expérience attendue : 3 à 8+ ans en ingénierie Data
- Rémunération : 42-50K€
- Certifications recommandées, Databricks Certified Data Engineer Associate (ou équivalent)
Apply for this position
This job is hosted externally. Click below to view the full posting and apply.
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Good distractions
Talks and stories from around this role — technically off-topic, practically not.
Moments
Explore playlistsVideos
See allRelated articles
See all
Top Big Data Technologies That You Need to Know
Best Companies to Work For in Paris: Top 25 Companies in 2023Â
Data Analyst Salary in the UK
Making Data Warehouses Fast: A Developer’s Story