> Markdown version of [/jobs/ext/1911421-lead-site-reliability-engineer-cloud-remote-f-h](https://www.wearedevelopers.com/jobs/ext/1911421-lead-site-reliability-engineer-cloud-remote-f-h). Every page supports `.md` or `Accept: text/markdown`. Links point to the HTML versions so they work for humans too. Agent guide: [/agents.md](https://www.wearedevelopers.com/agents.md). --- # Lead Site Reliability Engineer - Cloud - Remote - F/H - **Company:** Scalingo - **Location:** Strasbourg, France (Remote available) - **Experience:** Expert - **Contract:** Permanent contract - **Skills:** Admin Tools, Artificial Intelligence, Cloud Computing, Databases, Data Security, Site Reliability Engineering Practices - **Published:** August 4, 2026 - **Apply:** https://fr.indeed.com/viewjob?jk=2b720783621d6b08 ## About the Role Leadership technique * Être moteur dans l'organisation du travail de l'équipe (processus, rituels, documentation)., * Une solide expertise des environnements cloud et infrastructures distribuées, avec une culture forte de la haute disponibilité et de la fiabilité en production. * Une maîtrise des pratiques d'observabilité (logs, métriques, alerting) et une capacité de diagnostic structurée sur des incidents complexes. * Une bonne compréhension des environnements conteneurisés et de leurs enjeux opérationnels. * Des compétences confirmées en bases de données en production : fiabilité, sauvegardes, restauration, réplication et montée en charge. * Une pratique de l'Infrastructure as Code et de l'automatisation des environnements. * Une sensibilité aux enjeux de sécurité opérationnelle. * Une aisance dans l'utilisation des outils d'Intelligence Artificielle pour gagner en efficacité au quotidien. * Une capacité à évoluer dans des contextes complexes, changeants ou incertains, avec rigueur et fiabilité. * Une aisance dans la priorisation, y compris en situation d'incident. * Une communication claire et structurée, un goût pour la collaboration transverse et le partage des connaissances. * Une posture blameless, de la curiosité technique, du sang-froid et une attention portée à l'impact utilisateur. * Une capacité à exercer un leadership technique, à transmettre et à faire progresser les pratiques collectives. ## Description En tant que Lead Site Reliability Engineer, tu occupes une position clé à l'interface des équipes développement, infrastructure, sécurité et support. Ton rôle est à la fois : * technique, avec un fort impact sur la fiabilité et la performance de la plateforme, * structurant, en faisant évoluer les pratiques et les outils SRE et au-delà., * fédérateur, en accompagnant et faisant monter en compétence une équipe SRE de 2 personnes. Tu interviens aussi bien sur le fonctionnement quotidien de l'activité SRE que sur les projets stratégiques liés à la croissance de la plateforme. Référent ou référente technique, tu incarnes les bonnes pratiques SRE et contribues à diffuser une culture de la fiabilité, de l'automatisation et de l'excellence opérationnelle au sein de Scalingo. Pourquoi ce rôle est essentiel * Garantir la stabilité, la disponibilité et la résilience des systèmes en production. * Anticiper les défaillances et structurer des réponses efficaces aux incidents. * Industrialiser et automatiser l'exploitation de la plateforme. * Maintenir un haut niveau de qualité de service vis-à-vis de nos clients et de nos engagements contractuels (SLA). Chaque amélioration que tu apportes contribue directement à la robustesse de la plateforme, à la réduction des incidents, à la maîtrise des coûts opérationnels et à l'accompagnement de la croissance de Scalingo. Organisation & évolution Rattaché directement à un Engineering Manager, tu exerces un leadership technique et opérationnel fort, sans responsabilité hiérarchique directe. En raison de nos démarches de certifications relatives à la sécurité des données, ce poste devra être basé en France exclusivement. Selon notre Career path, des évolutions professionnelles sont possibles vers une spécialisation technique ou managériale., * Accompagner prioriser, revoir des choix techniques et des implémentations. * Contribuer à la montée en compétences les membres de l'équipe, en favorisant l'autonomie et la prise d'initiative. * Transmettre les bonnes pratiques SRE (fiabilité, observabilité, gestion d'incidents, automatisation). * Porter la vision technique SRE et la décliner dans les projets structurants. Fiabilisation et amélioration continue des services * Analyser les performances, identifier les points de contention et proposer des améliorations pour optimiser l'utilisation des ressources et la montée en charge. * Définir, mettre en place et améliorer les outils d'observabilité (monitoring, métriques, logs, alerting), dans une approche proactive. * Rédiger des processus d'exploitation, les maintenir et les faire évoluer. * Assurer une veille technologique continue afin de proposer des évolutions pertinentes de l'infrastructure. Gestion des incidents * Assurer une partie du support client de niveau 3, en lien avec les équipes support et selon les SLA. * Participer activement à la gestion des incidents, ainsi qu'aux cycles d'astreintes (environ une demi-semaine toutes les trois semaines). * Intervenir rapidement lors des incidents critiques afin d'en limiter l'impact et d'assurer la continuité des services. * Piloter et animer les rétrospectives d'incidents (post-mortems), en identifiant les causes racines et en définissant des actions correctives durables. * Rédiger et publier les rapports post-mortem à la suite des incidents majeurs. * Assurer la coordination et la communication de crise, en interne comme auprès des clients. Sécurité, conformité et continuité d'activité * Veiller au respect des engagements de service (SLA, RPO, RTO) sur le périmètre SRE. * Mettre en place des indicateurs de mesure de la qualité des services (SLO). * Contribuer activement à la conformité ISO 27001 et HDS : respect des processus, participation aux audits internes et externes. * Planifier, exécuter et analyser les tests réguliers des dispositifs de continuité et de reprise d'activité (PCA/PRA). Collaboration interne et contribution transverse * Collaborer étroitement avec les équipes de développement afin d'intégrer les exigences d'exploitabilité (fiabilité, performance, sécurité opérationnelle) dès la conception. * Être force de proposition auprès des équipes Produit Engineering sur les sujets de fiabilité, d'expérience client et des outils d'administration. * Contribuer à la rédaction, à la structuration et au maintien d'une documentation opérationnelle claire et à jour., * Budget d'équipements complémentaires (participation) Processus de recrutement * Call de pré-qualification (30 min) : nous t'appelons pour te présenter l'offre et la clarifier si besoin. C'est toi qui décides si tu souhaites poursuivre l'étape suivante. * Test de pré-screening (30 min) : un test standardisé de type QCM, à passer en ligne. Il nous permet d'évaluer les candidatures de manière objective, en limitant les biais de recrutement. Une note minimale est requise pour passer cette étape. * Test hard-skill (quelques heures) : un test technique à réaliser et à nous restituer à la date de ton choix dans un délai de 7 jours, après avoir pris connaissance des consignes. L'objectif est d'évaluer tes compétences, tes habitudes et tes bonnes pratiques en lien avec le poste. Nous t'encouragerons à démontrer que tu sais utiliser le meilleur de l'I.A. * Premier entretien structuré - skill & aptitude fit (1h30) : un échange avec les membres de l'équipe impliqués dans le recrutement, pour discuter de tes compétences et de ton expérience, et évaluer leur adéquation avec le poste. * Second entretien structuré - culture fit & confirmation mutuelle (1h30) : un entretien avec un co-fondateur ou un autre membre de l'équipe, afin de vérifier des deux côtés que nous avons envie de travailler ensemble. La vie chez Scalingo ## Related Videos - [Crypto-secure Data Management with In-Database Blockchain](https://www.wearedevelopers.com/videos/632-crypto-secure-data-management-with-in-database-blockchain) - [Shipping Faster with Less: Render on Cloud Hosting, AI Workloads, and the Future of DevOps](https://www.wearedevelopers.com/videos/1894-shipping-faster-with-less-render-on-cloud-hosting-ai-workloads-and-the-future-of-devops) - [How building with AI can double the throughput of your engineering team](https://www.wearedevelopers.com/videos/100238-how-building-with-ai-can-double-the-throughput-of-your-engineering-team) - [Kubernetes and Microservices with Multi-Model Databases](https://www.wearedevelopers.com/videos/382-kubernetes-and-microservices-with-multi-model-databases) - [Cyber Sleuth: Finding Hidden Connections in Cyber Data](https://www.wearedevelopers.com/videos/893-cyber-sleuth-finding-hidden-connections-in-cyber-data) - [SRE Methods In an Agency Environment](https://www.wearedevelopers.com/videos/348-sre-methods-in-an-agency-environment) ## Related Articles - [Fully Remote Software Engineer Jobs](https://www.wearedevelopers.com/magazine/447-fully-remote-software-engineer-jobs) - [Best Companies to Work For in France: Top 25 Companies in 2023 ](https://www.wearedevelopers.com/magazine/189-best-companies-to-work-for-in-france-top-25-companies-in-2023) - [Best Companies to Work For in Paris: Top 25 Companies in 2023 ](https://www.wearedevelopers.com/magazine/190-best-companies-to-work-for-in-paris-top-25-companies-in-2023) - [Find a Developer Job: 12 Best Job Sites For Developers](https://www.wearedevelopers.com/magazine/165-find-a-developer-job-12-best-job-sites-for-developers) - [Mastering Remote Work: Tips for Developers](https://www.wearedevelopers.com/magazine/558-mastering-remote-work-tips-for-developers) - [Best Job Boards for Remote Work for Developers](https://www.wearedevelopers.com/magazine/290-best-job-boards-for-remote-work-for-developers)