Research Engineer - Data

Periodic Labs
Menlo Park
Workplace: OnsiteFull timeUSD 350,000 - 400,000 annuallyFunction: Research & Scientific (R&D)Education: bachelorsSkills: ["Collaboration","Communication","Problem-solving","Attention to detail","Curiosity"]

Build and maintain data foundations for frontier ML models by owning end-to-end data strategy, sourcing external datasets, and integrating experimental data into the training stack. Collaborate closely with pretraining, midtraining, and RL researchers to design robust pipelines, ensure data quality at scale, and enable reproducible experiments across diverse scientific domains.

Loading

Loading job details...

Preparing the role view and application actions.

FursaFursa
Periodic Labs
Periodic Labs
3 months ago

Research Engineer - Data

✓ Verified Job

Canonical indexed version, validated from employer's careers page.

Source: Company careers pageValidated by: Fursa AI
Last checked: 2 hours agoStatus: Live

Job Summary

Build and maintain data foundations for frontier ML models by owning end-to-end data strategy, sourcing external datasets, and integrating experimental data into the training stack. Collaborate closely with pretraining, midtraining, and RL researchers to design robust pipelines, ensure data quality at scale, and enable reproducible experiments across diverse scientific domains.
Location: Menlo Park
Workplace: Onsite
Employment Type: Full time
Job Function: Research & Scientific (R&D)

Key Responsibilities

  • •Own data strategy across the training stack — identifying gaps, evaluating new sources, and shaping the overall data roadmap in collaboration with research leads.
  • •Source, evaluate, and procure external datasets across scientific domains including chemistry, physics, materials science, mathematics, and lab instrumentation.
  • •Build and maintain robust pipelines for ingesting, processing, and versioning large-scale datasets from heterogeneous sources.
  • •Design and implement data quality systems including deduplication, domain classification, quality filtering, and format normalization at scale.
  • •Integrate internally generated experimental data — from lab instrumentation, simulations, and model outputs — into the training stack in a structured and repeatable way.

Pay and Benefits

Salary: USD 350,000 - 400,000 annually

Key Requirements

  • •Experience building large-scale data pipelines for LLM pretraining or midtraining, including web-scale or scientific corpora.
  • •Expertise in data quality techniques such as deduplication (MinHash, SimHash), perplexity filtering, quality scoring, and PII scrubbing.
  • •Experience working with diverse scientific data formats — papers, patents, structured databases, simulation outputs, lab instrument exports — and normalizing them for model consumption.
  • •Experience with distributed data processing frameworks such as Apache Spark, Ray, or Dask at multi-terabyte to petabyte scale.
  • •Strong Python engineering skills and ability to build production-quality tooling in a research environment.
Experience:AIMLLLMResearch
Education:Bachelor's
Skills:CollaborationCommunicationProblem-solvingAttention to detailCuriosity
Languages:English
Tech Stack:PythonApache SparkRayDaskMinHashSimHashPII scrubbingDVCDelta Lake

Eligibility

Visa:H1BGreen CardUS Citizenship
Work Authorization:Sponsorship available.

Company Brief

Periodic Labs
Periodic Labs (periodic.com) — Public information about this company’s products, industry focus, size, funding, and headquarters is not available. Check the company’s official profiles or contact them directly for accurate details about their offerings and operations.
Industry: Other
Website