Systems Architect

Job ID: 113731
Location: Home, MD  [On-Site]
Category: App/Dev
Employment Type: Contract
Date Added: 10/05/2026

Apply Now

Fill out the form below to submit your information for this opportunity. Please upload your resume as a doc, pdf, rtf or txt file. Your information will be processed as soon as possible.


 
 
 
 
 
(Word, PDF, RTF, TXT)
⚠Notice: Job application forms are locked until Analytics cookies are accepted for fraud prevention tracking. Please click the cookie settings banner to unlock.
* Required field.

Role Summary

The Lead / Senior Site Reliability Engineer (SRE) supports complex, cloud-based environments and plays a key role in maintaining the reliability, resilience, and recoverability of mission-critical platforms. This position leads disaster recovery activities, platform rebuild validation, infrastructure automation, and modern deployment practices while partnering with cross-functional teams to support cloud modernization and operational continuity.

Responsibilities

  • Lead and support platform portability and disaster recovery (DR) exercises, including validation of platform rebuild procedures and recovery playbooks.
  • Execute infrastructure recovery activities and validate platforms against established recovery objectives.
  • Verify data completeness, integrity, and accuracy during recovery exercises and document findings and remediation recommendations.
  • Identify readiness gaps across infrastructure, deployment automation, monitoring, and data recovery processes and collaborate with engineering teams on corrective actions.
  • Design, implement, and support Infrastructure as Code (IaC) workflows using Terraform and AWS CloudFormation.
  • Build and maintain standardized CI/CD pipelines and automated deployment processes.
  • Manage and optimize Kubernetes clusters and containerized workloads using Docker, including provisioning, scaling, and reliability improvements.
  • Develop and maintain observability solutions using CloudWatch, Datadog, and similar monitoring and alerting tools.
  • Develop automation, tooling, and scripts using languages such as Python or Java to reduce manual processes and improve operational consistency.
  • Collaborate with platform engineering, security, application, and data teams to support secure and reliable platform operations.
  • Participate in on-call rotations, root cause analysis, and incident response activities to strengthen system resilience.
  • Provide technical leadership and guidance related to reliability, automation, recovery, and infrastructure best practices.

Basic Qualifications

  • Bachelor’s degree and 8 to 10 years of relevant experience in Site Reliability Engineering, DevOps, cloud engineering, infrastructure engineering, or a related area; a master’s degree and 6 to 8 years of relevant experience; or equivalent professional experience in lieu of a degree.
  • Advanced hands-on experience with AWS services across compute, networking, storage, IAM, and serverless technologies.
  • Strong experience with Infrastructure as Code tools such as Terraform and CloudFormation.
  • Experience building CI/CD deployment pipelines and progressive delivery processes using GitHub Actions or similar tools.
  • Strong knowledge of Kubernetes administration, container orchestration, and Docker-based deployments.
  • Experience validating disaster recovery processes, performing system rebuilds, and conducting data integrity checks.
  • Experience developing dashboards, metrics, logs, and alerts using CloudWatch, Datadog, or similar observability platforms.
  • Proficiency with programming or scripting languages such as Python, Java, C#, or Go.
  • Experience troubleshooting complex system failures, including network, distributed-system, and application reliability issues.
  • Strong analytical, documentation, and communication skills.
  • Ability to manage competing priorities while supporting mission-critical systems.

Preferred Qualifications

  • AWS DevOps, DevSecOps, or related certification.
  • Additional AWS certifications such as Solutions Architect, SysOps Administrator, or Developer.
  • Kubernetes certifications such as CKA or CKAD.
  • Familiarity with Zero Trust security principles and cloud security best practices.
  • Experience with GitLab, Jenkins, or similar CI/CD platforms.
  • Experience working within highly regulated environments.
  • Experience supporting large-scale enterprise cloud modernization initiatives.
  • Experience participating in disaster recovery exercises, continuity planning, or platform readiness assessments.

Additional Requirements

  • Ability to obtain and maintain a Position of Public Trust.
  • Availability to participate in an on-call rotation as required.
  • Availability to work authorized overtime based on project needs.
Publishing Pay Range: $56.00 – $60.00 Hourly