Senior Software Engineer, Capacity Management - DGX Cloud

NVIDIA
Santa Clara
Workplace: OnsiteFull timeUSD 200,000 - 322,000 annuallyFunction: Software EngineeringExperience: 12+ yearsEducation: bachelorsSkills: ["Communication","Technical design","Mentoring","Cross-functional collaboration","Problem-solving"]

Design and build distributed services and data pipelines for DGX Cloud capacity planning, allocation, reservations, and utilization. Develop a unified capacity model across cloud providers, regions, clusters, and products, and automate capacity-management workflows. Create APIs, tools, and integrations to help other teams make capacity-aware decisions, while improving forecasting, observability, monitoring, and service reliability. Lead technical design reviews and mentor engineers.

Loading

Loading job details...

Preparing the role view and application actions.

FursaFursa
NVIDIA
NVIDIA
1 day ago

Senior Software Engineer, Capacity Management - DGX Cloud

✓ Verified Job

Canonical indexed version, validated from employer's careers page.

Source: Company careers pageValidated by: Fursa AI
Last checked: 13 hours agoStatus: Live
Reposted: similar role first listed 1 week ago

Job Summary

Design and build distributed services and data pipelines for DGX Cloud capacity planning, allocation, reservations, and utilization. Develop a unified capacity model across cloud providers, regions, clusters, and products, and automate capacity-management workflows. Create APIs, tools, and integrations to help other teams make capacity-aware decisions, while improving forecasting, observability, monitoring, and service reliability. Lead technical design reviews and mentor engineers.
Location: Santa Clara
Workplace: Onsite
Employment Type: Full time
Job Function: Software Engineering
Seniority: Mid level

Key Responsibilities

  • •Design and build distributed services and data pipelines for capacity planning, allocation, reservations, and utilization.
  • •Develop a unified model for available, committed, and forecasted GPU capacity across providers, regions, clusters, and products.
  • •Automate capacity-management workflows currently dependent on manual analysis and coordination.
  • •Build APIs, tools, and integrations to enable DGX Cloud systems and teams to make capacity-aware decisions.
  • •Lead technical design reviews, establish engineering standards, and mentor engineers; diagnose production issues to improve reliability and scalability.

Pay and Benefits

Salary: USD 200,000 - 322,000 annually
Perks:Equity

Key Requirements

  • •BS or equivalent experience in Computer Science, Computer Engineering, or a related technical field.
  • •12+ years of software engineering experience building production systems.
  • •Strong programming experience in languages such as Python, Go, Java, or similar.
  • •Experience designing distributed systems, backend services, APIs, and data-processing pipelines.
  • •Experience with cloud infrastructure, Kubernetes, compute platforms, or large-scale resource-management systems.
Experience:12+ yearsProduction systemsDistributed systemsCloud infrastructure
Education:Bachelor's in Computer Science, Computer Engineering, or a related technical field
Skills:CommunicationTechnical designMentoringCross-functional collaborationProblem-solving
Tech Stack:PythonGoJavaAPIsData pipelinesKubernetes

Company Brief

NVIDIA
Designs and manufactures GPUs, AI accelerators, and system-on-chip products for gaming, data centers, professional visualization, and automotive markets, enabling advanced graphics, AI, and high-performance computing solutions worldwide.
Industry: Electronics Manufacturing
Company Size: Enterprise (1,001+ employees)
Revenue: USD 1B+
Growth: Public Company
Valuation: Public Company (Market Cap in USD)
Funding: IPO / Publicly Listed
Headquarters: Santa Clara, United States
Founded: 1993
Glassdoor
Glassdoor: 4.3
WebsiteLinkedInGlassdoor