Senior Site Reliability Engineer

NVIDIA
Israel
Workplace: OnsiteFull timeFunction: DevOps, Cloud & InfrastructureExperience: 12+ yearsEducation: bachelorsSkills: ["Analytical skills"]

Lead initiatives to evolve and scale core infrastructure services across on-premises and cloud environments. Design and deploy high-reliability systems such as DNS, NTP/PTP, DHCP, and LDAP, drive observability and DDoS mitigation using eBPF/XDP, and set performance and efficiency metrics. Build enterprise-wide capacity plans, develop tooling for reporting/alerting/monitoring, and partner with leadership, engineers, program, and product teams to deliver IT services at global scale.

Loading

Loading job details...

Preparing the role view and application actions.

FursaFursa
NVIDIA
NVIDIA
3 days ago

Senior Site Reliability Engineer

✓ Verified Job

Canonical indexed version, validated from employer's careers page.

Source: Company careers pageValidated by: Fursa AI
Last checked: 2 hours agoStatus: Live
Reposted: similar role first listed 5 days ago

Job Summary

Lead initiatives to evolve and scale core infrastructure services across on-premises and cloud environments. Design and deploy high-reliability systems such as DNS, NTP/PTP, DHCP, and LDAP, drive observability and DDoS mitigation using eBPF/XDP, and set performance and efficiency metrics. Build enterprise-wide capacity plans, develop tooling for reporting/alerting/monitoring, and partner with leadership, engineers, program, and product teams to deliver IT services at global scale.
Location: Israel
Workplace: Onsite
Employment Type: Full time
Job Function: DevOps, Cloud & Infrastructure
Seniority: Sr. Manager level

Key Responsibilities

  • •Lead initiatives to transform IT Compute Core architecture and build new infrastructure service offerings across on-premises and cloud environments.
  • •Design, scale, and deploy core infrastructure services with ownership of performance, reliability, automation, monitoring, high availability, capacity planning, and lifecycle management.
  • •Define and implement service-efficiency metrics and drive improvements through software and hardware optimization.
  • •Apply eBPF and XDP to improve observability, performance analysis, and DDoS-mitigation capabilities.
  • •Develop and maintain tools for collecting, analyzing, and visualizing data for reporting, alerting, and monitoring.

Key Requirements

  • •Bachelor’s degree in Engineering, Computer Science, Mathematics, or related field, or equivalent experience.
  • •12+ years of experience in compute platform engineering with strong automation and technical leadership in large-scale environments.
  • •Experience designing and deploying containerization architectures and distributed-systems infrastructure.
  • •Experience evaluating application architectures and identifying opportunities for containerization to improve scalability, reliability, and efficiency.
  • •Proficiency in Go, Python, or similar programming languages, plus strong Linux OS proficiency (including kernel internals).
Experience:12+ years
Education:Bachelor's
Skills:Analytical skills
Tech Stack:DNSNTPPTPDHCPLDAPSR-IOVDPUEBPFXDPTerraformLinuxGoPythonContainersContainerizationDistributed systemsDDoS mitigationVLANVXLANSDN

Company Brief

NVIDIA
Designs and manufactures GPUs, AI accelerators, and system-on-chip products for gaming, data centers, professional visualization, and automotive markets, enabling advanced graphics, AI, and high-performance computing solutions worldwide.
Industry: Electronics Manufacturing
Company Size: Enterprise (1,001+ employees)
Revenue: USD 1B+
Growth: Public Company
Valuation: Public Company (Market Cap in USD)
Funding: IPO / Publicly Listed
Headquarters: Santa Clara, United States
Founded: 1993
Glassdoor
Glassdoor: 4.3
WebsiteLinkedInGlassdoor