Senior Site Reliability Engineer, Colorado Springs

Onebrief
United States
Workplace: OnsiteFull timeUSD 180,000 - 220,000 annuallyFunction: DevOps, Cloud & InfrastructureExperience: 5+ yearsSkills: ["Communication","Collaboration","Problem-solving","Mentoring","Incident response"]

Senior Site Reliability Engineer for Onebrief’s Infrastructure & Security team. You’ll own reliability, scalability, and security of production deployments across on-prem DoD environments and AWS, lead incident response, design world-class observability, and automate IaC with Terraform/Ansible and Kubernetes. Collaborate with platform and application teams to reduce toil and improve resilience, monitoring, and runbooks.

Loading

Loading job details...

Preparing the role view and application actions.

FursaFursa
Onebrief
Onebrief
4 months ago

Senior Site Reliability Engineer, Colorado Springs

✓ Verified Job

Canonical indexed version, validated from employer's careers page.

Source: Company careers pageValidated by: Fursa AI
Last checked: 20 hours agoStatus: Live

Job Summary

Senior Site Reliability Engineer for Onebrief’s Infrastructure & Security team. You’ll own reliability, scalability, and security of production deployments across on-prem DoD environments and AWS, lead incident response, design world-class observability, and automate IaC with Terraform/Ansible and Kubernetes. Collaborate with platform and application teams to reduce toil and improve resilience, monitoring, and runbooks.
Location: United States
Workplace: Onsite
Employment Type: Full time
Job Function: DevOps, Cloud & Infrastructure
Seniority: Sr. Manager level

Key Responsibilities

  • •Own the reliability, scalability, and security of the production application and/or platform.
  • •Design, implement, and manage a World-Class Observability Platform (monitoring, logging, alerting) and translate metrics into actionable insights.
  • •Define and uphold reliability by measuring and owning alerting that feeds SLIs/SLOs.
  • •Lead incident response, including acting as incident responder or incident commander and coordinating blameless post-mortems/AARs.
  • •Automate for scale and security by building and managing secure, resilient Kubernetes clusters and cloud/on-prem environments using Infrastructure-as-Code (Terraform, Ansible).

Pay and Benefits

Salary: USD 180,000 - 220,000 annually
Equity and Bonus:Equity

Key Requirements

  • •Active Top Secret clearance required; SCI eligibility a plus.
  • •5+ years in Platform, DevOps, or Site Reliability Engineering with an infrastructure and operations focus.
  • •Proficiency with Infrastructure as Code (Terraform or CloudFormation) and Ansible.
  • •Experience with containers and orchestration (Kubernetes) and managing production-grade deployments.
  • •Scripting proficiency (Python, Go, or Bash) and familiarity with AWS; strong observability/monitoring experience (Grafana, ELK, Datadog).
Experience:5+ yearsDefenseMilitary
Skills:CommunicationCollaborationProblem-solvingMentoringIncident response
Tech Stack:PrometheusLokiAlloyGrafanaTerraformAnsibleKubernetesAWSGitLab CI/CDJenkinsGitHub ActionsPythonGoBashElkDatadog

Eligibility

Security Clearance:Top Secret

Company Brief

Onebrief
Provides an AI-enabled command operating system for military staff collaboration, operational planning, wargaming and decision support, used on classified and unclassified DoD networks to speed planning and execution.
Industry: Defense Technology
Company Size: Medium (51 to 250 employees)
Growth: Scaleup
Valuation: Unicorn (USD 1B+)
Funding: Series D
Headquarters: Honolulu, United States
Founded: 2019
Glassdoor
Glassdoor: 4.4
WebsiteLinkedInGlassdoor