Expert monitoring Datadog / Splunk (H/F)

HC
Puteaux, France
19 days ago

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience level
Expert
Experience required
7 years minimum
Working hours
Regular working hours
Languages
English, French
Job source

Tech stack

Application Programming Interfaces (APIs) Databases Middleware Infrastructure as a Service (IaaS) Service-Oriented Architecture Technical Data Management Systems Datadog Splunk Servicenow

Job description

Alignement avec la stratégie de monitoring et d?observabilité

Définir les exigences minimales de monitoring à respecter avant toute mise en production.

Identifier les composants critiques et les principaux parcours utilisateurs à superviser.

Définir les métriques, logs, traces, événements et indicateurs nécessaires à l?exploitation des services.

Mettre en place une approche structurée autour des concepts de disponibilité, performance, capacité, erreurs et saturation.

Contribuer à la stratégie globale d?observabilité et à la feuille de route des outils Datadog et Splunk.

Concevoir et mettre en oeuvre la supervision Datadog

Mettre en place la collecte des métriques

Configurer les intégrations Datadog

Concevoir les dashboards nécessaires aux équipes Run, Infrastructure, Applicatives et Management.

Mettre en oeuvre le suivi des services, API, URL, certificats, files d?attente et traitements batch.

Configurer des Service Maps permettant de visualiser les dépendances applicatives.

Créer et maintenir les monitors, alertes composites et règles de détection d?anomalies.

Mettre en oeuvre des mécanismes de corrélation entre métriques, traces et logs.

Automatiser autant que possible le déploiement des configurations et dashboards.

Concevoir et mettre en oeuvre la supervision Splunk

Définir les sources de logs à collecter et leurs règles d?intégration.

Configurer les flux de collecte et d?indexation des logs.

S?assurer de la qualité, de la complétude des données collectées.

Créer des dashboards techniques, applicatifs et opérationnels dans Splunk.

Développer les alertes nécessaires à la détection des incidents.

Mettre en place des mécanismes de corrélation entre événements issus de plusieurs composants.

Construire des tableaux de bord permettant de suivre les erreurs, les temps de réponse et les volumes de transactions.

Identifier dans les logs les causes probables d?un incident ou d?une dégradation de service.

Construire les indicateurs techniques et métiers

Identifier avec les équipes métiers les événements fonctionnels critiques à superviser.

Traduire les besoins opérationnels en indicateurs mesurables.

Mettre en place des dashboards combinant données techniques et données métiers.

Suivre notamment : le nombre de transactions traitées ;

le taux de succès et d?échec ;

les temps de traitement ;

Développer une supervision orientée service, et non uniquement orientée composants techniques.

Mettre en évidence l?impact métier d?une anomalie technique.

Définir et industrialiser le système d?alerting

Définir des seuils d?alerte pertinents basés sur les comportements réels des applications.

Éviter les alertes trop nombreuses, redondantes ou sans action possible.

Classifier les alertes selon leur niveau de criticité et leur impact.

Définir les destinataires et les circuits d?escalade associés à chaque type d?alerte.

Documenter pour chaque alerte (signification; contrôles ; diagnostic ; responsable; escalade)

Intégrer les alertes aux outils de communication et de gestion des incidents.

Contribuer à l?intégration avec ServiceNow afin d?automatiser, lorsque cela est pertinent, la création et l?enrichissement des incidents.

Réaliser régulièrement une revue des alertes afin de supprimer les faux positifs et d?améliorer leur pertinence.

Contribuer au passage du Build vers le Run

Produire le dossier de supervision nécessaire au passage en exploitation.

Documenter les dashboards, monitors, recherches Splunk et règles d?alerte.

Former les équipes à l?utilisation des outils.

Requirements

Minimum 7 années d?expérience en monitoring, observabilité ou production IT.

Expérience récente et significative sur Datadog et Splunk.

Capacité à configurer directement les outils, et pas uniquement à consulter des dashboards

Expérience de supervision d?applications critiques.

Bonnes capacités d?analyse et de diagnostic.

Compétences techniques

Maîtrise des outils de monitoring et d’observabilité : Datadog (APM, dashboards, alerting, monitors) et Splunk (indexation de logs, dashboards, alertes)

Bonne compréhension des architectures applicatives distribuées : IaaS, conteneurs, API, middlewares

Connaissance des bases de données SQL : lecture de requêtes, analyse de performances, identification de goulots d’étranglement côté base

Maîtrise des processus ITIL

La connaissance de Service Now est un plus

Compétences Fonctionnelles et Savoir-être : Leadership opérationnel, autonomie et proactivité

Sens du service, orienté(e) métier et résultat (compréhension de enjeux, priorisation)

Capacité d?analyse et de résolution de problèmes

Capacité à travailler au sein d’une organisation matricielle avec des équipes internationales et distantes

Langues : Anglais et Français courants. L’équipe étant internationale, la langue par défaut pour les échanges et les livrables est l’anglais

Rigoureux(se), méthodique, impliqué(e)

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on fr.indeed.com

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

3:04 min

Database evolution and the funding behind vector databases

Erik Bamberg · LIVE

5:34 min

Managing token budgets and enterprise usage of coding agents

Chris Heilmann +2 · LIVE

2:38 min

Establishing comprehensive monitoring and log management

Michael Eder +1 · LIVE

1:06 min

Developer experience and project variety at scale

Alexandra Petri · WWC 2023

4:01 min

Managing application isolation via pluggable database models

Wei Hu Wei Hu · WWC 2022

1:08 min

Analyzing error logs and root causes using artificial intelligence

Nishil Patel Nishil Patel · WWC 2025

Videos

See all

Related articles

See all