Research Scientist, Intelligent Editing and AI Agent (Multimodality) Graduate (Intelligent Creation) - Global Frontier Tech Recruitment Program - 2027 Start (PhD)

TikTok
San Jose
Full timeFunction: Data Science & Machine LearningEducation: phdSkills: ["Collaboration","Interpersonal skills"]

Conduct cutting-edge applied research for TikTok’s Intelligent Creation GenAI team, advancing multimodal foundation models for content creation, image/video generation, and intelligent editing. Work on end-to-end model training and post-training (SFT/RL), unified modeling for image/video generation, and agentic architectures including tool-calling and long-horizon capabilities. Explore new AI-driven product directions while building research-driven multimodal generation systems.

Loading

Loading job details...

Preparing the role view and application actions.

FursaFursa
TikTok
TikTok
1 month ago

Research Scientist, Intelligent Editing and AI Agent (Multimodality) Graduate (Intelligent Creation) - Global Frontier Tech Recruitment Program - 2027 Start (PhD)

✓ Verified Job

Canonical indexed version, validated from employer's careers page.

Source: Company careers pageValidated by: Fursa AI
Last checked: 21 hours agoStatus: Live

Job Summary

Conduct cutting-edge applied research for TikTok’s Intelligent Creation GenAI team, advancing multimodal foundation models for content creation, image/video generation, and intelligent editing. Work on end-to-end model training and post-training (SFT/RL), unified modeling for image/video generation, and agentic architectures including tool-calling and long-horizon capabilities. Explore new AI-driven product directions while building research-driven multimodal generation systems.
Location: San Jose
Employment Type: Full time
Job Function: Data Science & Machine Learning
Seniority: Graduate level

Key Responsibilities

  • •Conduct cutting-edge research and development in computer vision and machine learning, focusing on multimodal understanding, vision-language, and large-scale training.
  • •Develop new multimodal creation capabilities for image/video generation and editing using generative AI and agent technologies.
  • •Drive model performance improvements through unified modeling for image and video generation.
  • •Perform continual training and post-training of seed multimodal models and LLM using SFT/RL.
  • •Apply agent technologies and architectures, optimizing tool-calling and long-horizon task capabilities and researching agentic RL.

Key Requirements

  • •Completing or recently completed a PhD in Software Development, Computer Science, Computer Engineering, or a related technical discipline.
  • •Excellent collaboration and interpersonal skills.
  • •Strong algorithm and programming skills, with strong coding ability in Python and/or C++.
  • •Experience in multimodal understanding (e.g., video highlight detection and slicing, audio/music understanding).
  • •Experience with vision and language (e.g., image/video captioning, retrieval, VQA) and downstream language-model tasks for intelligent editing.
Experience:MultimodalComputer visionMachine learningGenerative AILanguage modelsReinforcement learning
Education:PhD / Doctorate
Skills:CollaborationInterpersonal skills
Tech Stack:PythonC++SFTRLRLHF

Company Brief

TikTok
Short-form video platform that lets users create, share, and discover entertainment content through algorithmic recommendations. It also offers advertising and creator tools for brands, influencers, and businesses.
Industry: Digital Media
Company Size: Enterprise (1,001+ employees)
Growth: Scaleup
Headquarters: Singapore, Singapore
Founded: 2016
WebsiteLinkedIn