Senior Applied Research Scientist, Data Curation

NVIDIA
Santa Clara, Texas, New York, Washington, Florida, California
Workplace: RemoteFull timeUSD 224,000 - 356,500 annuallyFunction: Data Science & Machine LearningExperience: 10+ yearsEducation: mastersSkills: ["Communication","Interpersonal skills","Mentoring","Collaboration","Research"]

Develop and optimize large-scale data curation and document extraction pipelines for foundation-model training. You’ll build models and petabyte-scale ingestion workflows for structured multimodal extraction and deduplication, define datasets/metrics and experiments, and collaborate with ML engineers to scale solutions into production via NVIDIA inference microservices. You’ll also publish and communicate research through papers, blogs, and documentation to improve data quality for Nemotron LLM training.

Loading

Loading job details...

Preparing the role view and application actions.

FursaFursa
NVIDIA
NVIDIA
4 days ago

Senior Applied Research Scientist, Data Curation

✓ Verified Job

Canonical indexed version, validated from employer's careers page.

Source: Company careers pageValidated by: Fursa AI
Last checked: 4 hours agoStatus: Live

Job Summary

Develop and optimize large-scale data curation and document extraction pipelines for foundation-model training. You’ll build models and petabyte-scale ingestion workflows for structured multimodal extraction and deduplication, define datasets/metrics and experiments, and collaborate with ML engineers to scale solutions into production via NVIDIA inference microservices. You’ll also publish and communicate research through papers, blogs, and documentation to improve data quality for Nemotron LLM training.
Location: Santa Clara, Texas, New York, Washington, Florida, California
Workplace: Remote
Employment Type: Full time
Job Function: Data Science & Machine Learning
Seniority: Mid level

Key Responsibilities

  • •Develop efficient data extraction and curation models and pipelines for multimodal content used in foundation-model training.
  • •Build petabyte-scale extraction and content deduplication pipelines, including document/html parsing and multiple deduplication approaches.
  • •Expand and optimize curation methodologies running on multi-node GPU clusters to improve foundation-model training datasets.
  • •Craft datasets, metrics, experiments, and validation scripts to establish research methodologies and guidance.
  • •Help scale pipelines to production by developing NVIDIA inference microservices (NIMs) and deployment blueprints, and publish research outputs.

Pay and Benefits

Salary: USD 224,000 - 356,500 annually
Equity and Bonus:Equity

Key Requirements

  • •Master’s, Ph.D., or equivalent experience in data curation, document AI, information retrieval, or multimodal research with a publication track record.
  • •10+ years developing multimodal systems across models and platforms, with information retrieval experience a plus.
  • •Hands-on experience building computer vision and document-extraction models and pipelines, including layout analysis and OCR.
  • •Proven expertise with distributed data frameworks such as Ray, Spark, or Dask and deploying large multi-node processing tasks in production.
  • •Strong Python skills and hands-on PyTorch (or comparable deep learning frameworks), plus experience with batching, streaming, and scaling ingestion pipelines.
Experience:10+ yearsMultimodal AIComputer visionInformation retrievalFoundation model trainingDistributed data processing
Education:Master's
Skills:CommunicationInterpersonal skillsMentoringCollaborationResearch
Tech Stack:PythonPyTorchRaySparkDaskOCRGPUHTML parsingFuzzy deduplicationSemantic deduplicationNVIDIA Inference Microservices (NIMs)

Company Brief

NVIDIA
Designs and manufactures GPUs, AI accelerators, and system-on-chip products for gaming, data centers, professional visualization, and automotive markets, enabling advanced graphics, AI, and high-performance computing solutions worldwide.
Industry: Electronics Manufacturing
Company Size: Enterprise (1,001+ employees)
Revenue: USD 1B+
Growth: Public Company
Valuation: Public Company (Market Cap in USD)
Funding: IPO / Publicly Listed
Headquarters: Santa Clara, United States
Founded: 1993
Glassdoor
Glassdoor: 4.3
WebsiteLinkedInGlassdoor