Research Scientist in Vision Foundation Model - Seed - Graduates - 2027 Start (PhD)
ByteDance
San Jose
Workplace: OnsiteFull timeFunction: Data Science & Machine LearningEducation: phdSkills: ["Problem-solving","Communication"]Build and scale vision foundation models for image and video, advancing multimodal generative modeling in GenAI. You’ll design end-to-end data pipelines, pre- and post-training strategies, and improve perception, reasoning, and multimodal understanding. Partner with the team to optimize model architectures, training efficiency, and evaluation frameworks, while exploring real-world multimodal applications.

