Deskripsi Pekerjaan
Informasi lengkap tentang posisi dan persyaratan
Ringkasan Yukerja
Lowongan Ingeniero PySpark di iCodde kami kurasi dari Himalayas (kategori Teknologi & IT). Posisi ini ditandai sebagai remote — pastikan timezone dan syarat lokasi kandidat di deskripsi resmi. Yukerja.com bukan pemberi kerja — lamaran diproses di situs sumber resmi.
Buscamos un(a) Ingeniero(a) PySpark Senior responsable de diseñar, desarrollar y optimizar procesos de ingeniería y transformación de datos utilizando Python y PySpark, asegurando la calidad, disponibilidad y eficiencia de grandes volúmenes de información.
La persona seleccionada participará en proyectos de Data Engineering, Big Data y procesamiento distribuido, colaborando con equipos de desarrollo, arquitectura, analítica y negocio para construir soluciones escalables y de alto rendimiento.
Responsabilidades
- Diseñar, desarrollar y mantener procesos de ETL/ELT utilizando PySpark y Python.
- Procesar y transformar grandes volúmenes de datos mediante arquitecturas distribuidas.
- Desarrollar pipelines de datos robustos, escalables y eficientes.
- Optimizar jobs de Spark, consultas y procesos de transformación para mejorar tiempos de ejecución y consumo de recursos.
- Trabajar con fuentes de datos estructuradas y no estructuradas.
- Integrar información proveniente de bases de datos, APIs, archivos y diferentes fuentes de información.
- Implementar procesos de validación, limpieza y transformación de datos.
- Participar en el diseño de arquitecturas de datos y soluciones Big Data.
- Monitorear y solucionar errores en pipelines y procesos de procesamiento de datos.
- Implementar buenas prácticas de desarrollo, control de versiones y documentación.
- Colaborar con Data Engineers, Data Scientists, DevOps, arquitectos y equipos de negocio.
- Participar en procesos de automatización y mejora continua de las plataformas de datos.
Requisitos técnicos
- +2 años de experiencia en Data Engineering o desarrollo de soluciones de procesamiento de datos.
- Experiencia sólida con PySpark y Python.
- Conocimiento de Apache Spark y procesamiento distribuido.
- Experiencia desarrollando procesos ETL/ELT.
- Manejo avanzado de SQL.
- Experiencia con bases de datos relacionales y/o NoSQL.
- Conocimiento de formatos como Parquet, JSON, CSV y Avro.
- Experiencia con herramientas de control de versiones, principalmente Git.
- Conocimiento de ambientes Linux/Unix.
- Experiencia con alguna plataforma Cloud como AWS, Azure o GCP.
- Deseable experiencia con servicios de datos como Databricks, AWS Glue, EMR, Azure Databricks, Synapse o similares.
- Deseable conocimiento de herramientas de orquestación como Airflow.
- Deseable experiencia con Docker y CI/CD.
Originally posted on Himalayas