Student Researcher (Seed Vision – Long-Range Video Generation) – 2026 Start (PhD)

ByteDance
San Jose
Workplace: OnsiteFull timeFunction: Research & Scientific (R&D)Education: phdSkills: []

Work on foundational visual-generation research within the Seed Vision team, focusing on long-range video generation. Build scalable architectures for consistent motion, identity, and layout, and explore hierarchical/recurrent latent structures to support long temporal spans. Tackle temporal drift, motion collapse, and high-frequency detail retention using autoregressive or chunked generation approaches. Design evaluation protocols to measure long-video realism and consistency.

Loading

Loading job details...

Preparing the role view and application actions.

FursaFursa
ByteDance
ByteDance
2 hours ago

Student Researcher (Seed Vision – Long-Range Video Generation) – 2026 Start (PhD)

✓ Verified Job

Canonical indexed version, validated from employer's careers page.

Source: Company careers pageValidated by: Fursa AI
Last checked: 2 hours agoStatus: Live

Job Summary

Work on foundational visual-generation research within the Seed Vision team, focusing on long-range video generation. Build scalable architectures for consistent motion, identity, and layout, and explore hierarchical/recurrent latent structures to support long temporal spans. Tackle temporal drift, motion collapse, and high-frequency detail retention using autoregressive or chunked generation approaches. Design evaluation protocols to measure long-video realism and consistency.
Location: San Jose
Workplace: Onsite
Employment Type: Full time
Job Function: Research & Scientific (R&D)
Seniority: Graduate level

Key Responsibilities

  • •Develop scalable architectures for long-range video generation with consistent motion, identity, and layout.
  • •Explore hierarchical or recurrent latent structures to support generation across long temporal spans.
  • •Address temporal drift, motion collapse, and high-frequency detail retention.
  • •Investigate autoregressive or chunked generation strategies that balance quality and memory.
  • •Design evaluation protocols for long-video quality (e.g., realism, consistency, semantic continuity).

Key Requirements

  • •Currently pursuing a PhD in Computer Vision, Machine Learning, or a related field.
  • •Research experience in generative modeling, especially for video, motion, or temporal sequences.
  • •First-author publications in CVPR, ICCV, ECCV, NeurIPS, ICLR, or ICML.
  • •Proficiency in deep learning frameworks and experience with large-scale video datasets.
  • •Experience with diffusion or transformer-based video models, or long-context sequence generation (preferred).
Education:PhD / Doctorate in Computer Vision, Machine Learning, or a related field
Tech Stack:Deep learningDiffusionTransformers

Eligibility

Work Authorization:Authorization required. Sponsorship not provided.

Company Brief

ByteDance
Develops consumer internet and content platforms, including TikTok and other apps for short-form video, news, and entertainment. It also builds advertising, commerce, and creator tools that connect audiences, brands, and publishers across global markets.
Industry: Digital Media
Company Size: Enterprise (1,001+ employees)
Revenue: USD 1B+
Growth: Established Company
Headquarters: Beijing, China
Founded: 2012
WebsiteLinkedIn