Senior Site Reliability Engineer - HPC
NVIDIA
Santa Clara, Austin, Durham
Workplace: OnsiteFull timeFunction: DevOps, Cloud & InfrastructureExperience: 5+ yearsEducation: bachelorsSkills: ["Communication","Documentation","Problem-solving","Debugging","Teamwork"]Join NVIDIA’s Compute Farm as a Senior SRE to own end-to-end reliability for high‑performance computing services. You’ll design, implement, and operate SRE solutions across multi‑cloud and on‑prem environments, using IaC and CI/CD to automate provisioning, drive observability, manage capacity, and lead incident reviews with a focus on uptime, QoS, and continuous improvement.

