Microservices architecture
Role details
Job location
Tech stack
Job description
Strong expertise in Microservices architecture with practical experience designing, deploying, and supporting distributed systems in production environments., Overview: The Director of AI Architecture & Platforms is responsible for defining, implementing, and governing the organization's enterprise AI architecture and technical strateg…
- 10 days ago
Requirements
Deep hands-on knowledge of Kubernetes (deployment management, scaling, upgrades, troubleshooting, cluster operations) with a focus on reliability, resilience, and performance. Working proficiency with API Gateway platforms such as Azure API Management (APIM), Kong, and IBM API Connect (APIC) for traffic management, rate limiting, routing, and API observability. Solid experience with observability tooling, including Splunk, AppDynamics, Instana, or similar solutions covering log analytics, metrics, traces, dashboards, alerting, and SLO-based monitoring. Ability to diagnose and resolve complex production issues, perform root cause analysis (RCA), and implement preventative measures. Familiarity with Site Reliability Engineering (SRE) best practices, including error budgets, SLIs/SLOs, incident response, postmortems, automation, and continuous improvement. Experience with performance tuning, capacity planning, and improving system reliability through scalable architectures and elimination of toil. As this is production support, the 2 resources should be able to support off-hour incidents, releases, and maintenance. Required Skills Microservices & Distributed Systems Microservices architecture Experience designing, deploying, and supporting distributed systems in production environments Kubernetes Deployment management Scaling Upgrades Troubleshooting Cluster operations Reliability, resilience, and performance optimization API Management Azure API Management (APIM) Kong IBM API Connect (APIC) Traffic management Rate limiting Routing API observability Observability & Monitoring Splunk AppDynamics Instana Log analytics Metrics Traces Dashboards Alerting SLO-based monitoring Site Reliability Engineering (SRE) Site Reliability Engineering (SRE) Error budgets SLIs/SLOs Incident response Postmortems Automation Continuous improvement Production Support Root Cause Analysis (RCA) Production issue diagnosis and resolution Preventative measures implementation Off-hour incident support Release support Maintenance support Performance & Reliability Performance tuning Capacity planning System reliability improvement Scalable architectures Elimination of toil Essential Skills Microservices Splunk Azure API Site Reliability Engineering (SRE) Skills: Digital : Splunk ~ Digital : Site Reliability Engineering (SRE) Experience Required: 4-6