Principal AWS Resilience & Site Reliability Consultant

Hays plc
London, UK
15 days ago
Apply on www.hays.co.uk
Prepare application

Role details

Contract type
Temporary contract
Employment type
Part-time (≤ 32 hours)
Working hours
Regular working hours
Job source

Tech stack

Amazon Web Services Backup Devices Software as a Service Cloud Computing Cloud Engineering Disaster Recovery Failover Real-Time Operating Systems Reliability Engineering Site Reliability Engineering Practices Web Platforms Backup and Restore
+5 more
Datadog Cloud Platform System Grafana Terraform Splunk

Job description

We’re seeking a Principal AWS Resilience & Site Reliability Consultant to help shape and deliver cloud resilience, disaster recovery and service reliability capabilities across a large-scale multinational technology environment.

3-month contract initially

London (1 day per week)

Inside IR35

Working within a highly available AWS platform estate, you’ll lead the design of recovery architectures, resilience frameworks and automated recovery capabilities, ensuring business-critical services remain secure, recoverable and available.

This role combines AWS architecture, disaster recovery, operational resilience, platform engineering and Site Reliability Engineering (SRE), making it ideal for a senior consultant who enjoys solving complex availability and recoverability challenges.

Responsibilities

  • Design and implement AWS-native backup, disaster recovery and resilience solutions
  • Define and govern recovery strategies, RTOs and RPOs for critical services
  • Lead adoption of AWS Backup, AWS Elastic Disaster Recovery (DRS), AWS Resilience Hub and multi-region recovery patterns
  • Develop backup & restore, pilot light, warm standby and active/active architectures
  • Drive Terraform adoption and Infrastructure as Code standards
  • Create automated recovery workflows, runbooks and operational playbooks
  • Establish SRE practices including SLIs, SLOs, observability and service reliability metrics
  • Lead disaster recovery testing, failover exercises and resilience assurance activities
  • Partner with engineering, architecture and leadership teams to improve platform recoverability and operational readiness
  • Provide technical leadership and strategic guidance across resilience initiatives

Essential Skills

  • Extensive AWS architecture and cloud platform experience
  • AWS Backup and AWS Elastic Disaster Recovery (DRS)
  • Disaster Recovery and Business Continuity planning
  • Terraform and Infrastructure as Code
  • AWS multi-account environments
  • Cross-region resilience and recovery architectures
  • Recovery testing, failover and failback planning
  • Strong understanding of Site Reliability Engineering principles
  • Automation and platform engineering experience
  • Excellent stakeholder management and consultancy skills

Desirable

  • AWS Resilience Hub
  • Cyber recovery and ransomware resilience
  • Observability tooling such as Grafana, Datadog, Splunk or Elastic
  • Experience supporting large-scale consumer-facing digital platforms
  • Gaming, media, entertainment, SaaS or cloud-native technology environments
  • AWS Solutions Architect Professional certification

Ideal Background

  • AWS Resilience Architect
  • AWS Disaster Recovery Architect
  • Principal AWS Consultant
  • Cloud Platform Architect
  • Site Reliability Architect
  • AWS Infrastructure Architect
  • Cloud Recovery & Resilience Consultant

This is an opportunity to play a key role in improving the resilience, recoverability and reliability of a globally distributed AWS platform supporting critical customer-facing services.

4827137 - Karl

Requirements

  • Extensive AWS architecture and cloud platform experience
  • AWS Backup and AWS Elastic Disaster Recovery (DRS)
  • Disaster Recovery and Business Continuity planning
  • Terraform and Infrastructure as Code
  • AWS multi-account environments
  • Cross-region resilience and recovery architectures
  • Recovery testing, failover and failback planning
  • Strong understanding of Site Reliability Engineering principles
  • Automation and platform engineering experience
  • Excellent stakeholder management and consultancy skills

Desirable

  • AWS Resilience Hub
  • Cyber recovery and ransomware resilience
  • Observability tooling such as Grafana, Datadog, Splunk or Elastic
  • Experience supporting large-scale consumer-facing digital platforms
  • Gaming, media, entertainment, SaaS or cloud-native technology environments
  • AWS Solutions Architect Professional certification

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.hays.co.uk
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

1:24 min

Evaluating formal AWS certifications versus raw practical engineering experience

Jan Giacomelli · LIVE

1:36 min

Visualizing memory limits and isolating suspicious endpoints

Dina Matveev Dina Matveev · Europe 2026 Virtual

10:40 min

Visualizing Prometheus open metrics using custom Grafana dashboards

Stijn Polfliet · LIVE

2:38 min

Establishing comprehensive monitoring and log management

Michael Eder +1 · LIVE

1:08 min

Analyzing error logs and root causes using artificial intelligence

Nishil Patel Nishil Patel · World Congress 2025

1:04 min

Visualizing Keycloak performance via standard Grafana troubleshooting dashboards

Alexander Schwartz Alexander Schwartz · World Congress 2025

Videos

See all

Related articles

See all