Reliability Engineer, Supercomputing
Thinking Machines Lab
San Francisco
Workplace: OnsiteFull timeUSD 350,000 - 475,000 annuallyFunction: Data Analytics & Business IntelligenceEducation: bachelorsSkills: ["Collaboration","Communication","Problem-solving","Initiative","Writing"]Engineer the reliability backbone of a GPU supercomputing fleet, owning hardware-software interfaces across drivers, kernel surface, and OS. Diagnose, reproduce, and remediate hardware issues at scale; automate fleet monitoring; drive firmware lifecycle and coordinate with vendors to implement real fixes for researchers running large-scale AI experiments.

