Data Engineer - Equipo de LLMs Training - IT

MercadoLibre
Bogotá
Workplace: HybridFull timeFunction: Education & TrainingSkills: ["Autonomía","Buenas prácticas","Colaboración","Pensamiento analítico","Orientación a calidad"]

Diseñarás y escalarás pipelines y procesos para preparar datos textuales a escala para el entrenamiento de LLMs, incluyendo curación (calidad, deduplicación, scoring y diversificación) y generación de datos sintéticos con modelos open source y comerciales. Construirás herramientas internas para estandarizar y escalar la preparación de datasets y colaborarás con Data Scientists y ML engineers para convertir necesidades de entrenamiento en pipelines confiables, probables y reproducibles. Trabajo híbrido en Bogotá.

Loading

Loading job details...

Preparing the role view and application actions.

FursaFursa
MercadoLibre
MercadoLibre
6 days ago

Data Engineer - Equipo de LLMs Training - IT

✓ Verified Job

Canonical indexed version, validated from employer's careers page.

Source: Company careers pageValidated by: Fursa AI
Last checked: 7 hours agoStatus: Live

Job Summary

Diseñarás y escalarás pipelines y procesos para preparar datos textuales a escala para el entrenamiento de LLMs, incluyendo curación (calidad, deduplicación, scoring y diversificación) y generación de datos sintéticos con modelos open source y comerciales. Construirás herramientas internas para estandarizar y escalar la preparación de datasets y colaborarás con Data Scientists y ML engineers para convertir necesidades de entrenamiento en pipelines confiables, probables y reproducibles. Trabajo híbrido en Bogotá.
Location: Bogotá
Workplace: Hybrid
Employment Type: Full time
Job Function: Education & Training

Key Responsibilities

  • •Construir y mantener pipelines de ingesta y procesamiento de datos textuales para entrenamiento de LLMs a escala.
  • •Implementar procesos de curación de datos con calidad, deduplicación, scoring y diversificación, tomando decisiones de ingeniería con autonomía.
  • •Escalar la generación de datos sintéticos usando modelos open source y comerciales.
  • •Construir y mantener herramientas internas para estandarizar y escalar la preparación de datasets.
  • •Colaborar con Data Scientists y ML engineers para traducir necesidades de entrenamiento en pipelines concretos.

Key Requirements

  • •Experiencia en ingeniería de datos de texto con Python, SQL, BigQuery y pipelines ETL a escala.
  • •Implementar buenas prácticas de ingeniería enfocadas en testing, versionado y reproducibilidad.
  • •Construir pipelines de datos end-to-end con criterio propio y autonomía.
  • •Demostrar interés en el ecosistema de LLMs y deep learning para evaluar el impacto de los datos en los modelos.
  • •Tener experiencia trabajando con procesos de curación de datos como calidad, deduplicación, scoring y diversificación.
Experience:LLMsDeep learningData engineeringAI
Skills:AutonomíaBuenas prácticasColaboraciónPensamiento analíticoOrientación a calidad
Tech Stack:PythonSQLBigQueryETLPipelinesLLMsDeep learningModelos open sourceModelos comercialesDatos sintéticosTestingVersionado

Company Brief

MercadoLibre
Operates Latin America's leading e‑commerce marketplace and fintech ecosystem, offering online buying and selling, classifieds, payment processing, credit, and logistics services across multiple countries in the region.
Industry: Online Marketplaces
Company Size: Enterprise (1,001+ employees)
Revenue: USD 1B+
Growth: Public Company
Valuation: Public Company (Market Cap in USD)
Funding: IPO / Publicly Listed
Headquarters: Buenos Aires, Argentina
Founded: 1999
Glassdoor
Glassdoor: 3.8
WebsiteLinkedIn