Mercado Libre

Data Engineer - Equipo de LLMs Training - IT

Mercado Libre Bogota, Capital District, RAP (Especial) Central, Colombia

Internet Publishing · 10,001+ employees

15 h ago
data-engineer Mid (2-5 yrs) Full-time Colombia
Log in to apply, save this posting, or score it against your profile with AI.

About the role

Build and maintain large-scale text data pipelines for LLM training and implement data curation processes such as deduplication and scoring. Collaborate with Data Scientists and ML engineers to scale synthetic data generation and standardize dataset preparation tools.

What they look for

Python SQL BigQuery ETL Pipelines Data Engineering LLM Training Data Curation Data Deduplication Synthetic Data Generation Deep Learning Software Testing Version Control Reproducibility Data Pipelines

Requirements

Requires experience in text data engineering using Python, SQL, BigQuery, and ETL pipelines at scale. Candidates must demonstrate autonomy, strong engineering practices regarding testing and versioning, and an interest in the LLM and deep learning ecosystem.

Full description

Como Data Engineer en Mercado Libre, diseñarás y escalarás sistemas innovadores y seguros que resuelven problemas reales y de alto impacto. Trabajarás en un entorno dinámico con tecnología de vanguardia, aplicando buenas prácticas de ingeniería, modelos de IA propios y aprendizaje continuo, con el propósito de democratizar el comercio electrónico y los servicios financieros en América Latina.

Imagináte emprendiendo proyectos desafiantes, dinámicos e innovadores y siendo responsable de:

  • Construir y mantener pipelines de ingesta y procesamiento de datos textuales a escala para entrenamiento de LLMs.
  • Implementar procesos de curación de datos como calidad, deduplicación, scoring y diversificación con autonomía en decisiones de ingeniería.
  • Escalar la generación de datos sintéticos utilizando modelos open source y comerciales.
  • Construir y mantener herramientas internas que estandarizan y escalan la preparación de datasets.
  • Colaborar con Data Scientists y ML engineers para traducir necesidades de entrenamiento en pipelines concretos.

¿Qué buscamos en vos?

  • Tener experiencia en ingeniería de datos de texto utilizando Python, SQL, BigQuery y pipelines ETL a escala.
  • Aplicar buenas prácticas de ingeniería orientadas a testing, versionado y reproducibilidad.
  • Demostrar autonomía para llevar pipelines de datos de inicio a fin con criterio propio.
  • Poseer interés en el ecosistema de LLMs y deep learning para comprender el impacto de los datos en los modelos.

¿Te animás a dejar huella en la tecnología de América Latina? ¡Postulate y sumate a nuestro propósito!

Modalidad de trabajo híbrida. Site: Bogotá, Colombia

Similar roles