Site Reliability Engineer Sre - Observabilité et Fiabilité H/F
Role details
Job location
Tech stack
Job description
Au sein de la Direction Relation Client et Production, le SRE intègre le pôle Observabilité et Fiabilité, dont la mission est de garantir la disponibilité, la performance, la résilience et l'observabilité du Système d'Information. Missions : Maintien en conditions opérationnelles
- Assurer le MCO des services, infrastructures et plateformes conformément aux objectifs de disponibilité et de qualité de service
- Participer au dispositif d'astreinte (1 semaine sur 5), incluant soirs, week-ends et jours fériés
Supervision et traitement des incidents
- Surveiller et analyser les événements, alertes et incidents de production
- Diagnostiquer, traiter et coordonner les incidents avec les équipes concernées
- Participer aux cellules d'incident et de crise
Anticipation et fiabilisation
- Anticiper les incidents par l'analyse des tendances, des capacités et des signaux faibles
- Réaliser les analyses post-incidents (RCA - Root Cause Analysis)
- Piloter les plans d'actions de fiabilisation
Observabilité
- Maintenir et faire évoluer les tableaux de bord, indicateurs et alertes
- Réduire le bruit opérationnel en optimisant les règles d'alerting
Amélioration continue
- Contribuer à l'automatisation, l'industrialisation et la simplification de l'exploitation
- Maintenir et enrichir la documentation, procédures et référentiels
- Participer aux démarches d'amélioration continue de la production, Un premier rendez-vous pour faire connaissance
- Un entretien RH
- Un entretien Technique
- Une proposition salariale
Requirements
Site Reliability Engineering (SRE) : maîtrise des concepts et pratiques
- Supervision / Observabilité : très bonne maîtrise de Prometheus, Grafana, Splunk (monitoring, logs, traces, métriques, alerting)
- Conteneurisation : forte aisance sur Kubernetes (environnements conteneurisés et orchestrés)
- Systèmes : Linux, Windows
- SGBD : PostgreSQL, MariaDB
- Socle applicatif : JBoss / Spring Boot
- Scripting : Python, Shell Linux
- Architectures : distribuées, microservices, infrastructures modernes Cloud/Hybrides
- Automatisation & DevOps : expérience confirmée des pratiques DevOps
- Gestion des incidents : ITIL / SRE, capacité à diagnostiquer et résoudre des incidents complexes, Shell Linux Grafana JBoss Création d'une base documentaire Kubernetes Python Amélioration continue PostgreSQL Scripting Spring Boot ITIL
Benefits & conditions
Dispositif d'astreinte 24/7
-
Lundi au vendredi : 18h30 - 0h30
-
Samedi et dimanche : 8h - 19h
-
Rythme : 1 semaine sur 5, Fourchette de salaire : entre 50 K€ et 55 K€, On coopte : prime de cooptation de 2000 €
-
On transmet : communauté d'experts
-
On partage : évènements et afterworks
-
On évolue : Management technique de proximité et formations, Accords RTT (1 jour/ mois) et Télétravail (2 à 3 jours/ semaine)
-
Prise en charge pour moitié du titre de transport et de la mutuelle
-
Carte titres restaurants Edenred