Data Engineer
Job Summary
Buscamos un Data Engineer con más de 5 años de experiencia para diseñar, integrar y operar los flujos de datos de nuestros clientes, asegurando calidad y trazabilidad. Tu misión será liderar la transformación tecnológica unificando el stack y estandarizando integraciones desde ERPs, SFTP y APIs. Trabajarás en un equipo en crecimiento con modalidad híbrida y horario flexible.
Responsibilities
- Diseñar, construir y operar pipelines de integración en producción
- Escribir procesos ETL y ELT en Python orquestados con Apache Airflow
- Definir contratos de datos e implementar reglas de calidad
- Cuadrar cifras con las del cliente y gestionar la observabilidad del pipeline
Required Skills
- 5+ años en roles de datos o 3+ como Data Engineer
- Python avanzado (pandas, pytest) y SQL avanzado (PostgreSQL)
- Experiencia con AWS (S3, RDS) y orquestadores como Airflow
- Conocimiento de integraciones ERP, APIs REST y bases NoSQL (MongoDB)
Job Details
Experiencia5+ años en roles de datos, o 3+ años como Data Engineer construyendo y operando pipelines en producción.Python y SQLPython avanzado para procesamiento de datos (pandas), con tests automatizados (pytest). SQL avanzado en PostgreSQL: modelado, índices, planes de ejecución y cargas incrementales (upserts).IntegraciónExperiencia integrando fuentes heterogéneas: APIs REST (autenticación, paginación), webhooks, SFTP, archivos planos y bases de datos de terceros. Diseño de procesos ETL/ELT con un orquestador (idealmente Airflow).Calidad y contratos de datosValidación de datos con esquemas y contratos (pandera, pydantic, Great Expectations o similares). Criterio para pensar la calidad del dato desde el diseño del pipeline.CloudAWS: S3, RDS y al menos un servicio de procesamiento (Glue, Lambda, Batch o ECS).ProjectsTu misión será diseñar, integrar y operar los flujos de datos de nuestros clientes, asegurando calidad, trazabilidad y cifras que cuadren con el origen. Reportarás al Líder de Inteligencia. FunctionsDiseñar, construir y operar pipelines de integración desde el origen de cada cliente (ERPs, APIs REST, webhooks, SFTP, VPN, archivos en S3) hasta PostgreSQL en AWS RDS.Escribir procesos ETL y ELT en Python, orquestados con Apache Airflow. Migrar los pipelines legados (AWS Glue y flujos heredados) al nuevo stack.Definir contratos de datos declarativos por cliente y entidad: esquema, tipos, vocabularios, ventanas de entrega y umbrales de cuarentena.Implementar reglas de calidad por dimensión (completitud, validez, unicidad, integridad referencial, consistencia, oportunidad) y verificar que cada transformación preserve los invariantes del dato.Diseñar el modelo de datos, versionarlo con migraciones y hacer el onboarding de clientes nuevos.Construir la observabilidad del pipeline: hallazgos de calidad por corrida, alertas y detección de fallas silenciosas, como el proceso que termina “con éxito” sin haber recibido un solo archivo.Cuadrar nuestras cifras con las del cliente, explicar cada diferencia y arreglar la causa en el pipeline.Gestionar accesos y credenciales de procesos y cuentas de servicio con mínimo privilegio.Documentar flujos, contratos de datos y procedimientos operativos.Trabajar con data science, producto e ingeniería en los datos que alimentan el motor de recomendaciones y la plataforma.BenefitsPipelines reales en producción, con ownership de punta a punta. Un equipo en crecimiento, con stack moderno y uso intensivo de IA en el día a día. Modalidad híbrida y horario flexible. Beneficios de deporte, educación, compra de equipo y días administrativos.5 días extras de vacacionesCultura horizontal y cercana.RequirementsDiseñaste integraciones batch y streaming (eventos, webhooks, CDC o colas de mensajes). Migraste pipelines entre plataformas sin detener la operación. Manejas migraciones de esquema y versionamiento del modelo de datos. Diseñas software desacoplado y mantenible (SOLID, arquitectura hexagonal o similar). Trabajaste con bases NoSQL, en particular MongoDB. Conoces contenedores y CI/CD. Integraste ERPs (SAP u otros) y entiendes su modelo comercial: facturas, pedidos, catálogo y clientes. Usas IA aplicada al desarrollo (Claude Code, MCP u otras): agentes, subagentes, skills y flujos automatizados con LLMs. Te sientes cómodo/a levantando requerimientos directo con los equipos técnicos de los clientes. Documentas tus decisiones y sabes explicar un problema de datos a alguien que no es técnico. Conoces la industria de consumo masivo, distribución o e-commerce B2B. Lees inglés técnico sin problema (documentación, librerías, cursos).