Data Engineer GCP H/F
Role details
Job location
Tech stack
Job description
Vous êtes passionné(e) par la data, curieux(se) des technologies de pointe et motivé(e) par des projets complexes et innovants ?
Au sein de notre Business Unit Open Data & IA, vous interviendrez sur des missions à forte valeur ajoutée pour des clients Grands Comptes, dans un environnement hybride, agile et collaboratif. Le.a consultant.e interviendra sur les missions clés suivantes, visant à construire et maintenir une plateforme de données robuste et exploitable : Ingestion & Flux de Données :
- Conception, optimisation et déploiement de pipelines d'ingestion de données performants et robustes vers Google Cloud BigQuery.
Transformation des Données :
- Conception et implémentation de pipelines de transformation de données complexes et efficaces au sein de BigQuery.
Architecture Événementielle :
- Automatisation du flux de données dès leur mise à disposition en exploitant les services GCP de gestion des événements (Event-Driven Architecture) tels que Pub/Sub et Eventarc.
Orchestration Data/ML :
- Mise en œuvre et gestion de l'orchestration globale des flux de données, depuis le traitement initial jusqu'au lancement des services de calcul et de Machine Learning.
Exploitabilité de la Solution :
- Garantir la haute disponibilité et la maintenance du système par la mise en place d'une stratégie de logging complète, de mécanismes de gestion d'erreurs robustes et d'un monitoring efficace des flux de données.
Industrialisation & DevOps :
- Contribution à l'amélioration continue de la chaîne CI/CD et sécurisation du déploiement des livrables en production. Environnement fonctionnel & technique Plateforme Cloud :
Google Cloud Platform (GCP) : Maîtrise confirmée de l'ensemble de la plateforme. Services GCP Clés :
- Data Warehouse : BigQuery (SQL avancé requis).
- Flux & Ingestion de Données : Dataflow, Dataform, Eventarc, Pub/Sub.
- Orchestration : Google Cloud Workflows, Airflow, Kubeflow.
- Compute & Virtualisation : Cloud Run, Docker, notions sur Dataproc (PySpark) et GKE (Kubernetes).
- Exploitabilité & DevOps : Concepts d'observabilité (Logging, Monitoring) sur GCP.
Environnement de Développement : Langages : Python (pour transformation de données et automatisation), SQL, notions de script Shell. Méthodes & Outils Méthodologie :
- Culture DevOps appliquée à l'écosystème GCP.
- Approche d'amélioration continue de la chaîne CI/CD.
Outils & Technologies :
- Data Engineering : BigQuery, Dataflow, Dataform, Pub/Sub, Eventarc, Cloud Workflows.
- Orchestration : Airflow, Cloud Workflows.
- Déploiement & Conteneurisation : Docker, Cloud Run, notions de GKE.
- Langages de Scripting : Python, SQL, Shell.
- Observabilité : Solutions de Logging et Monitoring GCP.
- CI/CD : Outils et pratiques liés à la chaîne d'intégration et de déploiement continus sur GCP.
Requirements
- Data Science : Compréhension du cycle de vie d'un modèle Machine Learning.
- Visualisation de Données : Connaissance de Power BI.