Ingeniero/a de Datos

Compañía
Descripción
Resumen: Únase como Ingeniero/a de Datos para construir una base de datos fiable y preparada para análisis en una empresa regulada de crédito y préstamos. Aspectos destacados: 1. Función fundamental de ingeniería de datos en un entorno regulado de datos 2. Oportunidad de construir canalizaciones de datos robustas y reproducibles 3. Enfoque en calidad de datos, trazabilidad y armonización **Acerca del proyecto** ***(descripción, duración, fase)*** ========================================================== Únase a Neurons Lab como **Ingeniero/a de Datos** en una nueva colaboración con una **empresa regulada de crédito y préstamos del Reino Unido e Irlanda**. El cliente ha extraído datos de múltiples entidades comerciales hacia un lago de datos centralizado y **anonimizado**, pero carece de la profundidad necesaria en ingeniería de datos para hacerlo fiable y listo para análisis: las canalizaciones actuales se ensamblaron rápidamente (en parte con asistencia de IA), y las estadísticas descriptivas **aún no pueden validarse ni reproducirse**. Usted sentará esa base sobre fundamentos sólidos para que el responsable de Ciencia de Datos pueda modelar con confianza — valide y reingenierice las canalizaciones, construya la **capa de armonización / semántica** entre entidades, aplique controles rigurosos de calidad y trazabilidad de datos, y prepare conjuntos de datos limpios y listos para características. Se trata de una **función fundamental de ingeniería de datos en un entorno regulado de datos**; la protección de datos y la reproducibilidad son las restricciones primarias en cada decisión. **Preferible compromiso a tiempo completo.** **Qué hará realmente** ***(ejemplos de tareas)*** ================================================= * **Reproducir un informe de estadísticas descriptivas de extremo a extremo**, de modo que cualquier cifra se remonte a la fuente original — cerrando la brecha reconocida por el cliente (cifras que actualmente no pueden defenderse). * Analizar y **conciliar esquemas de origen distintos** entre entidades adquiridas: mapear nombres de campos, tipos, codificaciones y definiciones comerciales diferentes para el mismo concepto en un modelo unificado. * Construir **modelos intermedios de almacenamiento en capa de staging con dbt**, incluyendo pruebas; codificar las definiciones armonizadas especificadas por el responsable de Ciencia de Datos. * Escribir **conjuntos de expectativas con Great Expectations** (verificaciones de nulos / rangos / unicidad / integridad referencial) e integrarlos en la canalización, de modo que los datos incorrectos fallen de forma explícita en lugar de corromper silenciosamente los análisis. * Implementar **resolución de entidades / identidades** (coincidencia determinista y difusa) cuando no exista una clave compartida limpia para el mismo cliente o cuenta entre distintas fuentes. * Implementar y **verificar la anonimización / seudonimización** (hashing / tokenización / k-anonimato) y documentar que el riesgo de reidentificación está controlado, según lo requieren los equipos de TI y cumplimiento del cliente. * **Optimizar trabajos Spark / Glue sobre decenas de millones de filas** — particionamiento, formatos de archivo (Parquet), cargas incrementales, control de costes. * Orquestar mediante **Airflow / Step Functions**; construir canalizaciones repetibles y programadas, en lugar de scripts únicos. * Preparar **conjuntos de datos limpios, documentados y listos para características**, destinados a los modelos de PD (probabilidad de impago) y morosidad. * Documentar **manuales operativos (runbooks)** para que el equipo externo (offshore) pueda operar las canalizaciones, permitiendo una transferencia de conocimientos en días, no semanas; ayudar a definir el alcance de la incorporación de las fuentes restantes (Irlanda y adicionales). **Habilidades** ---------- * Fuerte dominio de **SQL** y **Python** para procesamiento de datos a gran escala * **Pila de datos AWS**: S3, Glue, Lake Formation, Athena / Redshift, EMR / Spark, Step Functions / Airflow * **Modelado de datos y capa semántica** (dbt o equivalente); modelado dimensional * **Resolución de entidades / vinculación de registros** entre fuentes heterogéneas * **Marco de calidad de datos y pruebas** (Great Expectations, pruebas de dbt) y trazabilidad de datos * Técnicas de **anonimización / seudonimización** y sus compromisos analíticos * Procesamiento de big data (Spark) con optimización de rendimiento y costes a escala * Inglés escrito y hablado claro; elabora documentación para transferencia de conocimientos y colabora eficazmente con equipos distribuidos **Conocimientos** ------------- * Fundamentos del **Reglamento General de Protección de Datos (RGPD)** aplicados a datos financieros anonimizados / seudonimizados y a la residencia de datos en el Reino Unido y la UE * **AWS Well-Architected** (Analytics, Seguridad) para el sector financiero, bancario y de seguros (BFSI) * Conocimiento de estructuras de datos crediticios / de riesgo y de las necesidades de los consumidores de modelado downstream — ventaja adicional **Experiencia** -------------- * **Más de 4 años** en ingeniería de datos, con sólida experiencia en **AWS y Spark / SQL a gran escala** * Experiencia demostrada en **armonización / integración de datos procedentes de múltiples sistemas fuente** * Experiencia en construcción de **canalizaciones validadas y reproducibles en entornos regulados** (BFSI, salud, administración pública) — ventaja muy valorada * Capacidad para incorporarse a un **entorno de datos caótico y parcialmente desarrollado**, y elevarlo al nivel requerido * Capacidad para desempeñar el rol de **ingeniero/a de datos único/a o líder** en un pequeño equipo de entrega (3–4 personas)
Publicado por

David Muñoz
Indeed · HR


