Expert Monitoring / Observability - Datadog & Splunk (H/F)

RIDCHA DATA
Canton of Courbevoie-2, France
yesterday

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours
Languages
French
Experience level
Senior

Job location

Canton of Courbevoie-2, France

Tech stack

API
Business Software
Databases
Ansible
Datadog
Delivery Pipeline
Terraform
Splunk
Microservices

Job description

ContexteDans le cadre d'un programme international de transformation digitale, nous recherchons un Expert Monitoring / Observability afin de concevoir, déployer et industrialiser une plateforme de supervision pour une application métier critique à forte volumétrie.

Vous interviendrez sur un environnement stratégique nécessitant une haute disponibilité et accompagnerez les équipes techniques durant les phases de Build, Go-Live et Run. Votre mission sera de garantir une visibilité complète sur la performance des applications, d'anticiper les incidents et d'améliorer en continu la qualité de service grâce à une stratégie d'observabilité robuste.

Vous évoluerez dans un contexte international et collaborerez avec des équipes Infrastructure, Production, Développement et Management.

Vos missionsConcevoir et mettre en ?uvre une architecture d'observabilité de bout en bout (Logs, Metrics, Traces, APM).

Développer et maintenir des dashboards, monitors et alertes sur Datadog et Splunk.

Définir les indicateurs de performance et de qualité de service (SLI, SLO, SLA).

Industrialiser les modèles de supervision via des templates et standards de monitoring.

Automatiser le déploiement des dashboards et des configurations de monitoring à l'aide d'outils IaC (Terraform, Ansible ou équivalent).

Intégrer les solutions d'observabilité dans les pipelines CI/CD.

Collaborer avec les équipes de développement pour améliorer l'instrumentation des applications (logs structurés, tracing distribué, APM).

Analyser les incidents complexes grâce à la corrélation des logs, métriques, traces et données APM.

Accompagner la transition des applications du Build vers le Run et contribuer à l'amélioration continue des processus d'exploitation.

Produire des reportings et recommandations destinés aux équipes techniques et aux parties prenantes.

Requirements

Compétences techniques indispensablesExpertise avancée sur Datadog :

Dashboards

Monitors & Alerting

APM

Logs

Metrics

Traces

Synthetic Monitoring

Expertise avancée sur Splunk : Ingestion et parsing

Requêtes SPL

Dashboards

Alerting

Reporting

Solide expérience dans la supervision d'applications critiques à haute disponibilité.

Excellente maîtrise de l'analyse d'incidents et de la corrélation des signaux d'observabilité.

Connaissance des architectures distribuées (microservices, APIs, bases de données, messaging).

Maîtrise des concepts SRE (SLI, SLO, SLA, Error Budget).

Expérience de l'automatisation avec Terraform, Ansible ou outils équivalents.

Expérience de l'intégration des outils d'observabilité dans des pipelines CI/CD.

Compétences appréciéesConnaissance d'un environnement Transport Management System (TMS) ou Supply Chain.

Bonnes connaissances des pratiques ITIL (Incident, Problem, Change Management).

Qualités recherchéesExcellente capacité d'analyse et de résolution de problèmes complexes.

Autonomie et sens de l'organisation.

Leadership transverse et capacité à fédérer des équipes pluridisciplinaires.

Aisance dans un environnement international et matriciel.

Capacité à intervenir dans des contextes de production exigeants.

Apply for this position