Expert Monitoring / Observability - Datadog & Splunk (H/F)

RIDCHA DATA
Puteaux, France
19 days ago

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience level
Expert
Working hours
Regular working hours
Job source

Tech stack

Application Programming Interfaces (APIs) Business Software Databases Ansible Datadog Delivery Pipeline Terraform Splunk Microservices

Job description

ContexteDans le cadre d’un programme international de transformation digitale, nous recherchons un Expert Monitoring / Observability afin de concevoir, déployer et industrialiser une plateforme de supervision pour une application métier critique à forte volumétrie.

Vous interviendrez sur un environnement stratégique nécessitant une haute disponibilité et accompagnerez les équipes techniques durant les phases de Build, Go-Live et Run. Votre mission sera de garantir une visibilité complète sur la performance des applications, d’anticiper les incidents et d’améliorer en continu la qualité de service grâce à une stratégie d’observabilité robuste.

Vous évoluerez dans un contexte international et collaborerez avec des équipes Infrastructure, Production, Développement et Management.

Vos missionsConcevoir et mettre en ?uvre une architecture d’observabilité de bout en bout (Logs, Metrics, Traces, APM).

Développer et maintenir des dashboards, monitors et alertes sur Datadog et Splunk.

Définir les indicateurs de performance et de qualité de service (SLI, SLO, SLA).

Industrialiser les modèles de supervision via des templates et standards de monitoring.

Automatiser le déploiement des dashboards et des configurations de monitoring à l’aide d’outils IaC (Terraform, Ansible ou équivalent).

Intégrer les solutions d’observabilité dans les pipelines CI/CD.

Collaborer avec les équipes de développement pour améliorer l’instrumentation des applications (logs structurés, tracing distribué, APM).

Analyser les incidents complexes grâce à la corrélation des logs, métriques, traces et données APM.

Accompagner la transition des applications du Build vers le Run et contribuer à l’amélioration continue des processus d’exploitation.

Produire des reportings et recommandations destinés aux équipes techniques et aux parties prenantes.

Requirements

Compétences techniques indispensablesExpertise avancée sur Datadog :

Dashboards

Monitors & Alerting

APM

Logs

Metrics

Traces

Synthetic Monitoring

Expertise avancée sur Splunk : Ingestion et parsing

Requêtes SPL

Dashboards

Alerting

Reporting

Solide expérience dans la supervision d’applications critiques à haute disponibilité.

Excellente maîtrise de l’analyse d’incidents et de la corrélation des signaux d’observabilité.

Connaissance des architectures distribuées (microservices, APIs, bases de données, messaging).

Maîtrise des concepts SRE (SLI, SLO, SLA, Error Budget).

Expérience de l’automatisation avec Terraform, Ansible ou outils équivalents.

Expérience de l’intégration des outils d’observabilité dans des pipelines CI/CD.

Compétences appréciéesConnaissance d’un environnement Transport Management System (TMS) ou Supply Chain.

Bonnes connaissances des pratiques ITIL (Incident, Problem, Change Management).

Qualités recherchéesExcellente capacité d’analyse et de résolution de problèmes complexes.

Autonomie et sens de l’organisation.

Leadership transverse et capacité à fédérer des équipes pluridisciplinaires.

Aisance dans un environnement international et matriciel.

Capacité à intervenir dans des contextes de production exigeants.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on fr.indeed.com

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

5:34 min

Managing token budgets and enterprise usage of coding agents

Chris Heilmann +2 · LIVE

1:42 min

Automating Skupper deployments using Ansible

Alex Soto Alex Soto · WWC 2024

2:38 min

Establishing comprehensive monitoring and log management

Michael Eder +1 · LIVE

3:09 min

Balancing data science skillings alongside systems engineering rigor

Nico Schmidt · LIVE

1:08 min

Analyzing error logs and root causes using artificial intelligence

Nishil Patel Nishil Patel · WWC 2025

3:19 min

Executing complex workflows using Ansible Automation Platform

Goetz Rieger Goetz Rieger · WWC 2025

Videos

See all

Related articles

See all