Senior GPU Kernel Optimization Engineer

AMD
Beijing
Workplace: OnsiteFull timeCNY 581,350 - 830,500 annuallyFunction: Solutions Engineering & Sales EngineeringExperience: 4+ yearsEducation: bachelorsSkills: ["Performance optimization","Profiling","Collaboration","Analysis","Automation"]

Design, develop, and optimize high-performance AI GPU kernels for training and inference. Profile and improve performance using techniques like memory optimization, kernel fusion, parallelization, and architecture-aware tuning. Build kernels with CUDA, HIP, and Triton, and collaborate with model and infrastructure teams to raise end-to-end AI system performance. Apply AI-assisted workflows to automate kernel generation, optimization, benchmarking, and validation.

Loading

Loading job details...

Preparing the role view and application actions.

FursaFursa
AMD
AMD
2 days ago

Senior GPU Kernel Optimization Engineer

✓ Verified Job

Canonical indexed version, validated from employer's careers page.

Source: Company careers pageValidated by: Fursa AI
Last checked: 12 hours agoStatus: Live
Reposted: similar role first listed 4 months ago

Job Summary

Design, develop, and optimize high-performance AI GPU kernels for training and inference. Profile and improve performance using techniques like memory optimization, kernel fusion, parallelization, and architecture-aware tuning. Build kernels with CUDA, HIP, and Triton, and collaborate with model and infrastructure teams to raise end-to-end AI system performance. Apply AI-assisted workflows to automate kernel generation, optimization, benchmarking, and validation.
Location: Beijing
Workplace: Onsite
Employment Type: Full time
Job Function: Solutions Engineering & Sales Engineering
Seniority: Mid level

Key Responsibilities

  • •Design, develop, and optimize high-performance AI operators and GPU kernels for training and inference workloads.
  • •Analyze and improve kernel performance via profiling, memory optimization, kernel fusion, parallelization, and architecture-aware tuning.
  • •Develop GPU kernels using CUDA, HIP, Triton, or similar programming frameworks.
  • •Build AI-powered coding agents and automation workflows for kernel generation, optimization, benchmarking, and validation.
  • •Collaborate with model and infrastructure teams to improve end-to-end AI system performance.

Pay and Benefits

Salary: CNY 581,350 - 830,500 annually

Key Requirements

  • •Bachelor’s degree or above in Computer Science, Computer Engineering, Artificial Intelligence, or a related field with 4+ years of relevant experience.
  • •Strong programming skills in C++ and/or Python.
  • •Hands-on experience developing and optimizing GPU kernels using CUDA, HIP, Triton, or similar frameworks.
  • •Solid understanding of GPU architecture and performance optimization (memory hierarchy, occupancy, register pressure, shared memory).
  • •Experience with performance profiling and optimization tools such as Nsight, rocprof, or equivalent.
Experience:4+ yearsAIGPUTrainingInference
Education:Bachelor's in Computer Science, Computer Engineering, Artificial Intelligence, or related field
Skills:Performance optimizationProfilingCollaborationAnalysisAutomation
Languages:En-us
Tech Stack:C++PythonCUDAHIPTritonNsightRocprofGEMMAttentionMoEEmbeddingLLMSFTRLHFDPOGRPO

Company Brief

AMD
Designs and produces semiconductor products including CPUs, GPUs, and adaptive SoCs for consumer, enterprise, and embedded markets, competing across PCs, data centers, and gaming industries.
Industry: Electronics Manufacturing
Company Size: Enterprise (1,001+ employees)
Revenue: USD 1B+
Growth: Public Company
Valuation: Public Company (Market Cap in USD)
Funding: IPO / Publicly Listed
Headquarters: Santa Clara, United States
Founded: 1969
Glassdoor
Glassdoor: 3.9
WebsiteLinkedIn