Cloud - Lead Sre Stockage H/F

Cnd
Le Kremlin-Bicêtre, France
3 days ago
Apply on www.hellowork.com
Prepare application

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience level
Expert
Working hours
Regular working hours

Tech stack

Amazon S3 Cloud Computing Linux Distributed Systems Python (Programming Language) Network Layer Open Source Technology Performance Tuning Ansible Prometheus Ceph (Software) Data Processing
+3 more
Grafana Terraform Programming Languages

Job description

En tant que Lead SRE Stockage, vous concevez, déployez et opérez l’infrastructure de stockage distribuée. Vos missions incluent :

  • Déployer et opérer le stockage bloc et objet au niveau régional puis étendre vers le multi-régions ; contribuer aux choix technologiques (e.g., Ceph ou alternatives) ;
  • Garantir l’isolation multi-tenant, la résilience et les performances du stockage distribué ;
  • Concevoir et opérer une architecture multi-régions résiliente face aux contraintes réseau (bande passante limitée, latence, coupures) en tenant compte du théorème CAP ;
  • Mettre en oeuvre les procédures de backup, restauration et de PRA ;
  • Déployer et opérer la stack d’observabilité sur vos périmètres ;
  • Conduire l’exploitation par les SLO, error budgets et RETEX ;
  • Participer à la gestion d’incidents (niveau N3/N4) et aux astreintes ;
  • Équipe : encadrer techniquement les ingénieurs stockage ; contribuer au recrutement et à la montée en compétences., Exploitation SRE de solutions de stockage distribué à grande échelle (Ceph, Longhorn, stack S3 ou équivalent) : déploiement, exploitation, optimisation ;
  • Dimensionnement de plateforme de stockage (IOPS, bande passante, latence) et arbitrages performance/coût/résilience ;
  • Observabilité avancée de stockage distribué avec alertes et métrologie ;
  • Tests de résilience et chaos engineering appliqué au stockage : perte de disques, partitions réseau, corruption de données ;
  • Gestion d’incidents en production (niveau N3/N4) et participation aux astreintes ;
  • Expérience de la culture SRE : pilotage par SLO/SLI, RETEX, amélioration continue. Vous disposez également des compétences techniques suivantes :

  • Expertise avancée sur au moins une solution de stockage distribuée bloc ou objet ;
  • Maîtrise de Linux avancé (optimisation performances, tuning kernel) et des couches réseau sous-jacentes

Requirements

Nous cherchons un expert stockage distribué : soit 10+ ans d’expérience en production, soit doctorat en systèmes distribués/stockage avec expérience significative en production de solutions à grande échelle.Vous possédez de l’expérience professionnelle :- Exploitation SRE de solutions de stockage distribué à grande échelle (Ceph, Longhorn, stack S3 ou équivalent) : déploiement, exploitation, optimisation ; - Dimensionnement de plateforme de stockage (IOPS, bande passante, latence) et arbitrages performance/coût/résilience ; - Observabilité avancée de stockage distribué avec alertes et métrologie ; - Tests de résilience et chaos engineering appliqué au stockage : perte de disques, partitions réseau, corruption de données ; - Gestion d’incidents en production (niveau N3/N4) et participation aux astreintes ; - Expérience de la culture SRE : pilotage par SLO/SLI, RETEX, amélioration continue.Vous disposez également des compétences techniques suivantes :- Expertise avancée sur au moins une solution de stockage distribuée bloc ou objet ; - Maîtrise de Linux avancé (optimisation performances, tuning kernel) et des couches réseau sous-jacentes ; - Maîtrise d’au moins un langage de programmation (Go, Python) et d’infrastructure-as-code (Terraform, Ansible) ; - Maîtrise d’une stack d’observabilité (Prometheus, Grafana, Loki) et des outils/méthodes de métrologie ; - Compréhension des fondamentaux théoriques : réplication, erasure coding, consensus distribué, cohérence sans consensus, théorème CAP ; - Capacité à concevoir des architectures résilientes face aux contraintes réseau (bande passante limitée, latence élevée, coupures) ; - Très bonne connaissance sécurité : multi-tenant, chiffrement at-rest/in-transit, gestion des secrets, capacité à dialoguer avec une chaîne SSI.Vous êtes :- Rigoureux : Capacité à concevoir et maintenir des infrastructures critiques avec une attention méticuleuse aux détails, particulièrement dans les aspects de sécurité et de reproductibilité ;- Innovant : Capacité à proposer des solutions techniques avancées et à implémenter des bonnes pratiques ;- Ancré dans une culture d’analyse factuelle et d’amélioration continue ;Atouts appréciés :- Expérience d’environnements multi-sites / multi-régions ;- Expérience avec des environnements avec de fortes exigences de disponibilité ;- Connaissance de SecNumCloud et IGI 1300 ;- Contributions open source, Nous cherchons un expert stockage distribué : soit 10+ ans d’expérience en production, soit doctorat en systèmes distribués/stockage avec expérience significative en production de solutions à grande échelle., Maîtrise d’au moins un langage de programmation (Go, Python) et d’infrastructure-as-code (Terraform, Ansible) ;

  • Maîtrise d’une stack d’observabilité (Prometheus, Grafana, Loki) et des outils/méthodes de métrologie ;
  • Compréhension des fondamentaux théoriques : réplication, erasure coding, consensus distribué, cohérence sans consensus, théorème CAP ;
  • Capacité à concevoir des architectures résilientes face aux contraintes réseau (bande passante limitée, latence élevée, coupures) ;
  • Très bonne connaissance sécurité : multi-tenant, chiffrement at-rest/in-transit, gestion des secrets, capacité à dialoguer avec une chaîne SSI. Vous êtes :

  • Rigoureux : Capacité à concevoir et maintenir des infrastructures critiques avec une attention méticuleuse aux détails, particulièrement dans les aspects de sécurité et de reproductibilité ;
  • Innovant : Capacité à proposer des solutions techniques avancées et à implémenter des bonnes pratiques ;
  • Ancré dans une culture d’analyse factuelle et d’amélioration continue ;

Atouts appréciés :

  • Expérience d’environnements multi-sites / multi-régions ;
  • Expérience avec des environnements avec de fortes exigences de disponibilité ;
  • Connaissance de SecNumCloud et IGI 1300 ;
  • Contributions open source

EUR

Ansible Prometheus Sauvegarde des données Linux Grafana SSI Elaboration d’un plan de reprise d’activité Optimisation des performances Rigueur et méthode Python

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.hellowork.com
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

2:15 min

Scaling IT operations for a major finance cloud

Linda Linda +1 · World Congress 2024

52 sec

Running persistent Linux environments directly on Windows

Ben Breard Ben Breard · World Congress 2025

1:42 min

Automating Skupper deployments using Ansible

Alex Soto Alex Soto · World Congress 2024

10:40 min

Visualizing Prometheus open metrics using custom Grafana dashboards

Stijn Polfliet · LIVE

4:36 min

Hiring passionate software engineers to tackle unprecedented scaling challenges

Dana Lawson Dana Lawson +1 · World Congress 2026 Europe

3:55 min

Demonstrating .NET installation on Debian and Azure Linux

Silvano Coriani Silvano Coriani · Europe 2026 Virtual

Videos

See all

Related articles

See all