North AmericaFull TimeEngineering
Remotely
awskubernetesiams3ekslambdavpccloudfront
Job Description
📋 Description
- Drive reliability engineering initiatives for AWS and Kubernetes services.
- Design deployment, release, and rollback strategies for distributed systems.
- Establish secure-by-default CI/CD pipelines with governance.
- Enhance observability with metrics, logs, tracing, and alerting.
- Define SLIs/SLOs and reliability standards.
- Lead high-severity incident responses and post-incident reviews.
🎯 Requirements
- 8+ years in SRE/Platform Eng/DevOps or related cloud-native roles.
- Deep AWS experience (EKS, IAM, VPC, Lambda, CloudFront, S3).
- Advanced experience with production Kubernetes operations.
- Strong Istio experience (traffic, security, observability).
- IaC expertise, preferably AWS CDK.
- CI/CD with GitHub Actions or similar.
🎁 Benefits
- Observability tooling experience (CloudWatch, OpenTelemetry, X-Ray).
- Experience with SLI/SLOs, alerting, runbooks, reliability metrics.
- TypeScript/Node.js for platform tooling and automation.
- Kubernetes architecture, Gateway API, ingress, networking.
- Zero-trust, mTLS, service-to-service security controls.
- Automated testing, code reviews, observability-driven development.