Systems Architect
Job ID: 113731
Location: Home, MD [On-Site]
Category: App/Dev
Employment Type: Contract
Date Added: 10/05/2026
Role Summary
The Lead / Senior Site Reliability Engineer (SRE) supports complex, cloud-based environments and plays a key role in maintaining the reliability, resilience, and recoverability of mission-critical platforms. This position leads disaster recovery activities, platform rebuild validation, infrastructure automation, and modern deployment practices while partnering with cross-functional teams to support cloud modernization and operational continuity.
Responsibilities
- Lead and support platform portability and disaster recovery (DR) exercises, including validation of platform rebuild procedures and recovery playbooks.
- Execute infrastructure recovery activities and validate platforms against established recovery objectives.
- Verify data completeness, integrity, and accuracy during recovery exercises and document findings and remediation recommendations.
- Identify readiness gaps across infrastructure, deployment automation, monitoring, and data recovery processes and collaborate with engineering teams on corrective actions.
- Design, implement, and support Infrastructure as Code (IaC) workflows using Terraform and AWS CloudFormation.
- Build and maintain standardized CI/CD pipelines and automated deployment processes.
- Manage and optimize Kubernetes clusters and containerized workloads using Docker, including provisioning, scaling, and reliability improvements.
- Develop and maintain observability solutions using CloudWatch, Datadog, and similar monitoring and alerting tools.
- Develop automation, tooling, and scripts using languages such as Python or Java to reduce manual processes and improve operational consistency.
- Collaborate with platform engineering, security, application, and data teams to support secure and reliable platform operations.
- Participate in on-call rotations, root cause analysis, and incident response activities to strengthen system resilience.
- Provide technical leadership and guidance related to reliability, automation, recovery, and infrastructure best practices.
Basic Qualifications
- Bachelor’s degree and 8 to 10 years of relevant experience in Site Reliability Engineering, DevOps, cloud engineering, infrastructure engineering, or a related area; a master’s degree and 6 to 8 years of relevant experience; or equivalent professional experience in lieu of a degree.
- Advanced hands-on experience with AWS services across compute, networking, storage, IAM, and serverless technologies.
- Strong experience with Infrastructure as Code tools such as Terraform and CloudFormation.
- Experience building CI/CD deployment pipelines and progressive delivery processes using GitHub Actions or similar tools.
- Strong knowledge of Kubernetes administration, container orchestration, and Docker-based deployments.
- Experience validating disaster recovery processes, performing system rebuilds, and conducting data integrity checks.
- Experience developing dashboards, metrics, logs, and alerts using CloudWatch, Datadog, or similar observability platforms.
- Proficiency with programming or scripting languages such as Python, Java, C#, or Go.
- Experience troubleshooting complex system failures, including network, distributed-system, and application reliability issues.
- Strong analytical, documentation, and communication skills.
- Ability to manage competing priorities while supporting mission-critical systems.
Preferred Qualifications
- AWS DevOps, DevSecOps, or related certification.
- Additional AWS certifications such as Solutions Architect, SysOps Administrator, or Developer.
- Kubernetes certifications such as CKA or CKAD.
- Familiarity with Zero Trust security principles and cloud security best practices.
- Experience with GitLab, Jenkins, or similar CI/CD platforms.
- Experience working within highly regulated environments.
- Experience supporting large-scale enterprise cloud modernization initiatives.
- Experience participating in disaster recovery exercises, continuity planning, or platform readiness assessments.
Additional Requirements
- Ability to obtain and maintain a Position of Public Trust.
- Availability to participate in an on-call rotation as required.
- Availability to work authorized overtime based on project needs.
