Research Scientist / Engineer – Training Infrastructure

Luma
Redwood City
Workplace: HybridFull timeFunction: Data Science & Machine LearningSkills: []

Build distributed training systems for Luma’s large-scale multimodal models running across thousands of GPUs. Design and optimize parallelization strategies (FSDP, Tensor Parallel, Pipeline Parallel, Expert Parallel), improve training stability and utilization, and create monitoring/visualization/debugging tools for large training runs. Partner with researchers so they can innovate on reliable, efficient, scalable infrastructure.

Loading

Loading job details...

Preparing the role view and application actions.

FursaFursa
Luma
Luma
2 weeks ago

Research Scientist / Engineer – Training Infrastructure

✓ Verified Job

Canonical indexed version, validated from employer's careers page.

Source: Company careers pageValidated by: Fursa AI
Last checked: 6 hours agoStatus: Live

Job Summary

Build distributed training systems for Luma’s large-scale multimodal models running across thousands of GPUs. Design and optimize parallelization strategies (FSDP, Tensor Parallel, Pipeline Parallel, Expert Parallel), improve training stability and utilization, and create monitoring/visualization/debugging tools for large training runs. Partner with researchers so they can innovate on reliable, efficient, scalable infrastructure.
Location: Redwood City
Workplace: Hybrid
Employment Type: Full time
Job Function: Data Science & Machine Learning
Seniority: Mid level

Key Responsibilities

  • •Design, implement, and optimize efficient distributed training systems for models across thousands of GPUs.
  • •Research and implement advanced parallelization (FSDP, Tensor Parallel, Pipeline Parallel, Expert Parallel).
  • •Build monitoring, visualization, and debugging tools for large-scale training runs.
  • •Optimize training stability, convergence, and resource utilization across massive clusters.
  • •Deliver initial improvements to stability/utilization and systematize reliability and efficiency at scale.

Key Requirements

  • •Extensive distributed PyTorch training and parallelism experience in foundation-model training.
  • •Deep understanding of GPU clusters, networking, and storage systems.
  • •Familiarity with communication libraries (NCCL, MPI) and distributed-system optimization.
  • •Experience with advanced parallelism/training at scale, including FSDP and multi-node training.
  • •Comfort shipping improvements that improve training stability, convergence, and resource utilization.
Tech Stack:PyTorchCUDAFSDPTensor ParallelPipeline ParallelExpert ParallelNCCLMPIGPU clustersLinuxContainerizationOrchestrationCloud infrastructure

Company Brief

Luma
Develops AI-powered tools for capturing, editing, and rendering high-quality 3D scenes from photos and videos, enabling creators to generate photorealistic 3D assets and spatial experiences.
Industry: AR/VR & Spatial Computing
Website