Chat rápido, mejores ofertas — Descargar

Data Engineer - Streaming & Batch Pipelines

Indeed

Compañía

Tipo de empleoTiempo completo
Modalidad de trabajoPresencial
Nivel de experiencia1 a 2 años
Nivel educativoLicenciatura

Descripción

**SE REQUIERE** Experiencia * 3\+ años de experiencia como Data Engineer en entornos productivos de gran volumen, con experiencia sólida en Apache Spark, tanto en procesamiento batch como en Spark Structured Streaming, utilizando PySpark o Scala. Estudios * Technical degree\-level education: Bachelor's degree in Engineering, Technology Sciences, Mathematics, Economics, Physics, Chemistry, Statistics, or similar. Technical skills * Apache Spark con PySpark o Scala: batch y Spark Structured Streaming. * Delta Lake: MERGE, upserts, time travel, optimización de ficheros y gestión de esquemas. * Apache Kafka y Confluent: productores y consumidores, particionado, Schema Registry y CDC mediante Debezium. * Ecosistema de datos de AWS: Glue, Data Catalog, ETL, Lambda, S3, EMR y EMR Serverless. * AWS Lake Formation: permisos a nivel de tabla y columna y gobierno de acceso. * Amazon SageMaker: integración de pipelines de datos con flujos de Machine Learning. * SQL avanzado y modelado de datos dimensional. * Change Data Capture y Slowly Changing Dimensions. * Git, CI/CD y buenas prácticas de testing en proyectos de datos. Otras informaciones Se valorará: * Experiencia con Kafka Streams o ksqlDB. * Experiencia con arquitecturas de lookup tables a gran escala, incluyendo point lookup, bucketing y Bloom Filters. * Conocimientos de Terraform o CloudFormation para infraestructura como código. * Experiencia en sectores regulados, especialmente en el sector financiero o de medios de pago. * Certificaciones AWS, como Data Analytics Specialty o Solutions Architect. * Buscamos un perfil con capacidad para realizar debugging profundo en sistemas distribuidos, autonomía y mentalidad "you build it, you run it". **RESPONSABILIDADES CLAVE** * Diseñar, construir y operar pipelines de ingesta y transformación de datos en tiempo real y por lotes sobre una plataforma AWS nativa de streaming basada en Kafka/Confluent, Spark Structured Streaming y Delta Lake, con foco en fiabilidad, rendimiento y escalabilidad. Actividades principales * Diseñar, desarrollar y mantener pipelines de streaming con Spark Structured Streaming y procesos batch sobre AWS. * Implementar lógica CDC, joins de enriquecimiento, gestión de checkpoints y offsets, y tratamiento de DLQ. * Integrar y mantener conectores y componentes de Confluent Kafka, incluyendo topics, Schema Registry, particionado y optimización del throughput. * Construir y optimizar tablas Delta Lake mediante particionado, Z\-Ordering o Liquid Clustering, compactación, operaciones MERGE/upsert y gestión de esquemas. * Desarrollar y mantener jobs en AWS Glue, incluyendo crawlers, catálogo y procesos ETL, así como funciones AWS Lambda para orquestación y procesamiento event\-driven. * Operar y optimizar cargas Spark en EMR y EMR Serverless mediante tuning de memoria, particionado, shuffle, Adaptive Query Execution y resolución de cuellos de botella. * Colaborar con los equipos de Data Science y Machine Learning en la preparación de datasets y pipelines de features para SageMaker. * Diseñar estrategias para gestionar tablas de referencia o lookup a gran escala, utilizando point lookup, caching y particionado para realizar joins de enriquecimiento eficientes. * Implementar monitorización, alertado y mecanismos de resiliencia para pipelines 24/7, incluyendo heartbeats, reintentos y checkpointing. * Evolucionar el framework interno de ETL basado en YAML y Spark, aplicando CI/CD, testing e infraestructura como código.

Fuentea: indeed

Publicado por

David Muñoz

Indeed · HR

Ubicación

David Muñoz

Indeed · HR

Empleos similares

Data Engineer - Streaming & Batch Pipelines empleo de Indeed en 2026 | ok.com