Descripción
Resumen:
Únase como Ingeniero de Datos para construir un lago de datos fiable y listo para análisis destinado a una empresa regulada de crédito y préstamos del Reino Unido e Irlanda.
Aspectos destacados:
1. Rol fundamental de ingeniería de datos en un entorno regulado de datos
2. Oportunidad de construir una capa semántica armonizada
3. Enfoque en protección de datos y reproducibilidad
**Acerca del proyecto** ***(descripción, duración, fase)***
==========================================================
Únase a Neurons Lab como **Ingeniero de Datos** en una nueva colaboración con una **empresa regulada de crédito y préstamos del Reino Unido e Irlanda**. El cliente ha extraído datos de múltiples entidades comerciales hacia un nuevo lago de datos centralizado y **anonimizado**, pero carece de la profundidad necesaria en ingeniería de datos para hacerlo fiable y listo para análisis: las canalizaciones actuales se ensamblaron rápidamente (en parte con asistencia de IA), y las estadísticas descriptivas **aún no pueden validarse ni reproducirse**.
Usted sentará esa base sobre fundamentos sólidos para que el responsable de Ciencia de Datos pueda desarrollar modelos con confianza: valide y reingenierice las canalizaciones, construya la **capa de armonización / semántica** entre entidades, aplique controles de calidad y trazabilidad de los datos, y prepare conjuntos de datos limpios y listos para características.
Este es un **rol fundamental de ingeniería de datos en un entorno regulado de datos**; la protección de datos y la reproducibilidad son las restricciones principales en cada decisión.
**Se prefiere una colaboración a tiempo completo.**
**Qué hará usted realmente** ***(tareas ejemplares)***
=================================================
* **Reproducir un informe de estadísticas descriptivas de extremo a extremo**, de modo que cualquier cifra pueda rastrearse hasta la fuente original — cerrando la brecha reconocida por el cliente (cifras que actualmente no pueden defenderse).
* Analizar y **conciliar esquemas de origen diferentes** entre entidades adquiridas: mapear nombres de campos, tipos, codificaciones y definiciones comerciales distintas para el mismo concepto en un modelo homogéneo.
* Construir **modelos intermedios de almacenamiento en etapas (staging) con dbt**, incluyendo pruebas; codificar las definiciones armonizadas especificadas por el responsable de Ciencia de Datos.
* Escribir **conjuntos de expectativas con Great Expectations** (verificaciones de nulos / rangos / unicidad / integridad referencial) e integrarlos en la canalización para que los datos incorrectos fallen de forma explícita, en lugar de corromper silenciosamente los análisis.
* Implementar **resolución de entidades / identidades** (coincidencia determinista y difusa) cuando no exista una clave compartida limpia para el mismo cliente o cuenta entre distintas fuentes.
* Implementar y **verificar anonimización / seudonimización** (hashing / tokenización / k-anonimato) y aportar evidencia de que el riesgo de reidentificación está controlado, para el equipo de TI / cumplimiento del cliente.
* **Optimizar trabajos Spark / Glue sobre decenas de millones de filas** — particionamiento, formatos de archivo (Parquet), cargas incrementales, control de costes.
* Orquestar mediante **Airflow / Step Functions**; construir canalizaciones programables y repetibles, en lugar de scripts únicos.
* Preparar **conjuntos de datos limpios, documentados y listos para características**, destinados a los modelos de PD / morosidad.
* Documentar **manuales operativos (runbooks)** para que el equipo externo (offshore) pueda operar las canalizaciones y la entrega se realice en días, no en semanas; ayudar a definir el alcance de la incorporación de las fuentes restantes (Irlanda y adicionales).
**Habilidades**
----------
* SQL y Python avanzados para procesamiento de datos a gran escala
* **Pila de datos de AWS**: S3, Glue, Lake Formation, Athena / Redshift, EMR / Spark, Step Functions / Airflow
* **Modelado de datos y capa semántica** (dbt o equivalente); modelado dimensional
* **Resolución de entidades / vinculación de registros** entre fuentes heterogéneas
* Marcos de **calidad de datos y pruebas** (Great Expectations, pruebas de dbt) y trazabilidad de datos
* Técnicas de **anonimización / seudonimización** y sus compromisos analíticos
* Procesamiento de big data (Spark) con optimización de rendimiento y costes a escala
* Inglés escrito y hablado claro; documentos para la entrega y capacidad de trabajo eficaz con equipos distribuidos
**Conocimientos**
-------------
* Fundamentos del **Reglamento General de Protección de Datos (RGPD)** aplicados a datos financieros anonimizados / seudonimizados y a la residencia de datos en el Reino Unido y la UE
* Principios de **AWS Well-Architected** (Analytics, Seguridad) para el sector financiero, bancario y de seguros (BFSI)
* Conocimiento general de estructuras de datos crediticios / de riesgo y de lo que necesitan los consumidores de modelado downstream — ventaja adicional
**Experiencia**
--------------
* **Más de 4 años** en ingeniería de datos, con experiencia sólida en **AWS y Spark / SQL a escala**
* Experiencia demostrada en **armonización / integración de datos provenientes de múltiples sistemas de origen**
* Experiencia en construcción de **canalizaciones validadas y reproducibles en entornos regulados** (BFSI, salud, gobierno) — ventaja importante
* Capacidad para incorporarse a un **entorno de datos complejo y parcialmente construido**, y elevarlo al nivel requerido
* Capacidad para desempeñarse como único ingeniero de datos o como líder de ingeniería de datos en un pequeño equipo de entrega (3–4 personas)