> Markdown version of [/jobs/ext/3183066-lead-sre-f-h](https://www.wearedevelopers.com/jobs/ext/3183066-lead-sre-f-h). Every page supports `.md` or `Accept: text/markdown`. Links point to the HTML versions so they work for humans too. Agent guide: [/agents.md](https://www.wearedevelopers.com/agents.md). --- # LEAD SRE (F/H) - **Company:** NEXPUBLICA FRANCE - **Location:** Clichy, France - **Experience:** Expert - **Contract:** Permanent contract - **Skills:** Cloud Computing, Continuous Integration, Octopus Deploy, Reliability Engineering, Prometheus, Delivery Pipeline, Grafana, Gitlab, Kubernetes, Terraform - **Published:** September 17, 2026 - **Apply:** https://www.indeed.com/viewjob?jk=1387f182e98d563d ## About the Role * Excellente maîtrise des environnements Cloud et des architectures distribuées. * Solide expertise Kubernetes et des écosystèmes conteneurisés. * Expérience avancée des outils d'observabilité et de monitoring. * Maîtrise des pratiques Infrastructure as Code et GitOps. * Bonne connaissance des pipelines CI/CD et de l'automatisation. * Compréhension des enjeux de sécurité applicative et infrastructure. * Sensibilité aux problématiques FinOps et optimisation des ressources Cloud., * Leadership technique et capacité à fédérer les équipes. * Excellent sens de l'analyse et de la résolution de problèmes. * Capacité à prendre des décisions dans des contextes critiques. * Esprit de coopération et aisance dans les environnements transverses. * Excellentes compétences en communication et en vulgarisation technique. * Rigueur, autonomie et sens des responsabilités. Environnement technique Notre plateforme s'appuie principalement sur les technologies suivantes : * Kubernetes * Terraform * Argo CD * GitLab * Prometheus * Thanos * Grafana * Loki * Vault, Formation supérieure en informatique, systèmes ou infrastructures. * Expérience significative en Site Reliability Engineering, plateforme Cloud ou exploitation à grande échelle. * Expertise avérée des environnements Kubernetes et des architectures distribuées. * Expérience concrète de la gestion d'incidents critiques et des dispositifs d'astreinte. * Maîtrise des pratiques d'observabilité, d'automatisation et de CI/CD. * Expérience en tant que Lead, référent technique ou accompagnement d'équipe. * Capacité à travailler dans un environnement exigeant, collaboratif et orienté amélioration continue. Pourquoi nous rejoindre ? * Participer à la construction et à l'évolution d'une plateforme Cloud stratégique. * Relever des défis techniques à fort impact. * Évoluer dans un environnement favorisant l'autonomie, la collaboration et l'innovation. * Contribuer activement à la diffusion des bonnes pratiques SRE et à l'amélioration continue des services. ## Description Véritable référent(e) de la fiabilité de la plateforme, vous êtes garant(e) de la disponibilité, de la performance et de la résilience des services hébergés. Vous accompagnez l'équipe SRE au quotidien, définissez les bonnes pratiques et assurez une collaboration étroite avec les équipes Produit, Infrastructure et Sécurité afin d'améliorer en continu l'expérience de nos utilisateurs. Missions et activités principales Assurer la fiabilité et l'observabilité de la plateforme * Définir, suivre et faire évoluer les indicateurs SLI, SLO et SLA des produits. * Concevoir et maintenir les tableaux de bord, métriques et mécanismes d'alerte. * Garantir un niveau d'observabilité adapté sur l'ensemble des services. * Anticiper les problématiques de capacité, de performance et de montée en charge. * Améliorer continuellement la disponibilité et la résilience de la plateforme. Piloter la gestion des incidents * Coordonner la gestion des incidents majeurs et animer les cellules de crise. * Mobiliser et accompagner les différentes équipes jusqu'au retour à la normale. * Organiser les analyses post-incidents et assurer le suivi des plans d'actions. * Améliorer les procédures d'exploitation, les runbooks et les mécanismes d'alerte. * Participer à l'organisation et à l'amélioration du dispositif d'astreinte. Accompagner les projets et les mises en production * Intervenir en amont des projets pour intégrer les exigences de fiabilité et d'exploitabilité. * Participer au dimensionnement des infrastructures et à l'estimation des coûts associés. * Valider la préparation opérationnelle des produits avant leur passage en production. * Fiabiliser les pipelines CI/CD et les déploiements GitOps. * Automatiser les tâches récurrentes et optimiser les opérations de production. Garantir le maintien en conditions opérationnelles et la sécurité * Assurer le suivi des sauvegardes, correctifs et montées de version. * Participer à la définition, aux tests et à l'amélioration des PCA/PRA. * Collaborer avec les équipes Infrastructure et Sécurité dans le suivi des vulnérabilités. * Veiller au respect des standards techniques et des bonnes pratiques de la plateforme. Contribuer à l'optimisation des coûts Cloud * Suivre la consommation des ressources Cloud. * Identifier les écarts, dérives et leviers d'optimisation. * Rechercher le meilleur équilibre entre performance, fiabilité et maîtrise des coûts. Animer et faire grandir l'équipe SRE * Définir les priorités et contribuer à la feuille de route SRE. * Accompagner les ingénieurs SRE dans leur montée en compétences. * Apporter un support sur les problématiques techniques complexes. * Faire évoluer la documentation, les standards et les processus d'onboarding. * Promouvoir la culture SRE auprès des différentes équipes. * Être l'interlocuteur privilégié sur les sujets liés à la fiabilité des services. ## Related Videos - [GitLab CI pipelines for a whole company](https://www.wearedevelopers.com/videos/143-gitlab-ci-pipelines-for-a-whole-company) - [Monitoring as Code - Managing your dashboards at scale](https://www.wearedevelopers.com/videos/753-monitoring-as-code-managing-your-dashboards-at-scale) - [Infrastructure as Code: The Developer's Secret Weapon](https://www.wearedevelopers.com/videos/1221-infrastructure-as-code-the-developer-s-secret-weapon) - [SRE Methods In an Agency Environment](https://www.wearedevelopers.com/videos/348-sre-methods-in-an-agency-environment) - [Enabling automated 1-click customer deployments with built-in quality and security](https://www.wearedevelopers.com/videos/83-enabling-automated-1-click-customer-deployments-with-built-in-quality-and-security) - [WeAreDevelopers LIVE - Modern DevOps for IoT Devices and More](https://www.wearedevelopers.com/videos/1805-wearedevelopers-live-modern-devops-for-iot-devices-and-more) ## Related Articles - [Best Companies to Work For in France: Top 25 Companies in 2023 ](https://www.wearedevelopers.com/magazine/189-best-companies-to-work-for-in-france-top-25-companies-in-2023) - [Best Companies to Work For in Paris: Top 25 Companies in 2023 ](https://www.wearedevelopers.com/magazine/190-best-companies-to-work-for-in-paris-top-25-companies-in-2023) - [Fully Remote Software Engineer Jobs](https://www.wearedevelopers.com/magazine/447-fully-remote-software-engineer-jobs) - [How We Built a Worry-Free System That Runs for 10+ Years – And What We’d Do Again](https://www.wearedevelopers.com/magazine/751-how-we-built-a-worry-free-system-that-runs-for-10-years-and-what-we-d-do-again) - [What Are The Top Skills Required For Azure Developers?](https://www.wearedevelopers.com/magazine/77-what-are-the-top-skills-required-for-azure-developers) - [Where To Find Software Engineering Jobs](https://www.wearedevelopers.com/magazine/396-where-to-find-software-engineering-jobs)