Research MLE (Training Optimization)大模型训练优化工程师

Canva
Beijing
Workplace: HybridFull timeFunction: Education & TrainingSkills: ["Communication","Problem-solving","Collaboration"]

Lead system-first efforts to scale and optimize training for large-scale multimodal foundation models. Design distributed training systems using Megatron-LM, NVIDIA NeMo, FSDP, and Triton, improving GPU utilization, communication overhead, and memory efficiency. Partner with research and modeling teams to align systems with algorithmic needs, evaluate best practices for distributed training, and perform low-level optimization with custom CUDA or Triton kernels.

Loading

Loading job details...

Preparing the role view and application actions.

FursaFursa
Canva
Canva
2 months ago

Research MLE (Training Optimization)大模型训练优化工程师

✓ Verified Job

Canonical indexed version, validated from employer's careers page.

Source: Company careers pageValidated by: Fursa AI
Last checked: 17 hours agoStatus: Live

Job Summary

Lead system-first efforts to scale and optimize training for large-scale multimodal foundation models. Design distributed training systems using Megatron-LM, NVIDIA NeMo, FSDP, and Triton, improving GPU utilization, communication overhead, and memory efficiency. Partner with research and modeling teams to align systems with algorithmic needs, evaluate best practices for distributed training, and perform low-level optimization with custom CUDA or Triton kernels.
Location: Beijing
Workplace: Hybrid
Employment Type: Full time
Job Function: Education & Training
Seniority: Mid level

Key Responsibilities

  • •Design, implement, and optimize large-scale machine learning training systems.
  • •Improve training performance across GPU utilization, communication overhead, and memory efficiency.
  • •Collaborate with research and modeling teams to align systems with algorithmic requirements.
  • •Evaluate and apply best practices for distributed training using leading frameworks.
  • •Debug, profile, and fine-tune training workflows, including low-level optimization with custom CUDA or Triton kernels.

Key Requirements

  • •Strong background in LLMs, multimodal AI, or diffusion models.
  • •Proficiency in Python, with familiarity in a system language such as C++ or Rust.
  • •Deep knowledge of PyTorch or JAX, plus libraries such as Megatron-LM, NVIDIA NeMo, or DeepSpeed.
  • •Familiarity with distributed training/optimization techniques such as FSDP/ZeRO, gradient checkpointing, or low-precision data types.
  • •Hands-on experience writing custom GPU kernels in CUDA or Triton.
Skills:CommunicationProblem-solvingCollaboration
Languages:English
Tech Stack:PythonC++RustPyTorchJAXMegatron-LMNVIDIA NeMoDeepSpeedFSDPTritonCUDAZeROGradient checkpointing

Company Brief

Canva
Canva is an online visual communications platform that provides drag-and-drop design tools, templates, and media assets for creating presentations, social media graphics, videos, documents and more, serving individuals and large enterprises globally.
Industry: Enterprise Software
Company Size: Enterprise (1,001+ employees)
Revenue: USD 1B+
Growth: Scaleup
Valuation: Decacorn (USD 10B+)
Funding: Series E+
Headquarters: Surry Hills, New South Wales, Australia
Founded: 2012
Glassdoor
Glassdoor: 3.9
WebsiteLinkedInGlassdoor