Ingeniero de Datos

Indeed

Compañía

Tipo de empleoTiempo completo
Modalidad de trabajoPresencial
Nivel de experienciaSin requisito de experiencia
Nivel educativoSin requisito de título

Descripción

Resumen: Únase como Ingeniero de Datos para construir un entorno de datos confiable y listo para análisis para una empresa regulada de crédito y préstamos, centrándose en la protección de datos y la reproducibilidad. Aspectos destacados: 1. Rol fundamental de ingeniería de datos en un entorno regulado de datos 2. Oportunidad de construir un lago de datos confiable y listo para análisis 3. Trabajo con la pila de datos de AWS, Spark, SQL y herramientas avanzadas de calidad de datos **Acerca del proyecto** ***(descripción, duración, etapa)*** ========================================================== Únase a Neurons Lab como **Ingeniero de Datos** en una nueva colaboración con una **empresa regulada de crédito y préstamos del Reino Unido e Irlanda**. El cliente ha extraído datos de múltiples entidades comerciales hacia un lago de datos recién centralizado y **anonimizado**, pero carece de la profundidad en ingeniería de datos necesaria para hacerlo confiable y listo para análisis: las canalizaciones actuales se ensamblaron rápidamente (en parte con asistencia de IA), y las estadísticas descriptivas **aún no pueden validarse ni reproducirse**. Usted sentará esa base sobre una base sólida para que el responsable de Ciencia de Datos pueda modelar con confianza: valide y reingenierice las canalizaciones, construya la **capa de armonización / semántica** entre entidades, imponga calidad de datos y trazabilidad, y prepare conjuntos de datos limpios y listos para características. Este es un **rol fundamental de ingeniería de datos en un entorno regulado de datos**; la protección de datos y la reproducibilidad son las restricciones principales en cada decisión. **Se prefiere una colaboración a tiempo completo.** **Qué hará concretamente** ***(ejemplos de tareas)*** ================================================= * **Reproducir un informe de estadísticas descriptivas de extremo a extremo**, de modo que cualquier cifra se remonte a la fuente original — cerrando la brecha reconocida por el cliente (cifras que actualmente no pueden defenderse). * Analizar y **reconciliar esquemas de fuentes distintas** entre entidades adquiridas: mapear nombres de campos, tipos, codificaciones y definiciones comerciales diferentes para el mismo concepto en un modelo unificado. * Construir **modelos intermedios de almacén de staging con dbt**, incluyendo pruebas; codificar las definiciones armonizadas especificadas por el responsable de Ciencia de Datos. * Escribir **conjuntos de expectativas de Great Expectations** (verificaciones de nulos / rangos / unicidad / integridad referencial) y conectarlos a la canalización para que los datos incorrectos fallen de forma evidente, en lugar de corromper silenciosamente el análisis. * Implementar **resolución de entidades / identidades** (coincidencia determinista y difusa) donde no exista una clave compartida limpia para el mismo cliente o cuenta entre fuentes. * Implementar y **verificar la anonimización / seudonimización** (hashing / tokenización / k-anonimato) y demostrar que el riesgo de reidentificación está controlado ante los equipos de TI / cumplimiento del cliente. * **Optimizar trabajos de Spark / Glue sobre decenas de millones de filas** — particionamiento, formatos de archivo (Parquet), cargas incrementales, control de costos. * Orquestar con **Airflow / Step Functions**; construir canalizaciones repetibles y programadas, en lugar de scripts únicos. * Preparar **conjuntos de datos limpios, documentados y listos para características**, destinados a los modelos de PD / morosidad. * Documentar **manuales operativos (runbooks)** para que el equipo externo (offshore) pueda operar las canalizaciones y la entrega se realice en días, no en semanas; ayudar a delimitar la incorporación de las fuentes restantes (Irlanda y adicionales). **Habilidades** ---------- * Fuerte dominio de **SQL** y **Python** para procesamiento de datos a gran escala * **Pila de datos de AWS**: S3, Glue, Lake Formation, Athena / Redshift, EMR / Spark, Step Functions / Airflow * **Modelado de datos y capa semántica** (dbt o equivalente); modelado dimensional * **Resolución de entidades / vinculación de registros** entre fuentes heterogéneas * Marcos de **calidad de datos y pruebas** (Great Expectations, pruebas de dbt) y trazabilidad de datos * Técnicas de **anonimización / seudonimización** y sus compromisos analíticos * Procesamiento de big data (Spark) con optimización de rendimiento y costos a escala * Inglés escrito y hablado claro; documentos para entrega y colaboración eficaz con equipos distribuidos **Conocimientos** ------------- * Fundamentos del **Reglamento General de Protección de Datos (RGPD)** aplicados a datos financieros anonimizados / seudonimizados y residencia de datos en el Reino Unido y la UE * **AWS Well-Architected** (Analytics, Security) para el sector BFSI * Conocimiento de estructuras de datos de crédito / riesgo y de lo que necesitan los consumidores de modelado downstream — ventaja adicional **Experiencia** -------------- * **4 años o más** en ingeniería de datos, con experiencia sólida en **AWS y Spark / SQL a escala** * Experiencia demostrable en **armonización / integración de datos entre múltiples sistemas fuente** * Experiencia en construcción de **canalizaciones validadas y reproducibles en un entorno regulado** (BFSI, salud, gobierno) — ventaja importante * Capacidad para integrarse en un **entorno de datos caótico y parcialmente construido**, y elevarlo a los estándares requeridos * Capacidad para actuar como único o ingeniero de datos líder en un pequeño equipo de entrega (3–4 personas)

Fuentea: indeed
Parte del contenido se ha traducido automáticamente

Publicado por

David Muñoz

Indeed · HR

Ubicación

Empleos similares

David Muñoz

Indeed · HR

Empleos similares

Ingeniero de Datos de Indeed en 2026 | ok.com