Descripción
**Acerca del proyecto** ***(descripción, duración, etapa)***
----------------------------------------------------------
Líder de Ciencia de Datos **práctico y operativo** en una nueva colaboración con una **empresa regulada del Reino Unido e Irlanda especializada en crédito y préstamos**. El cliente ha consolidado datos procedentes de múltiples entidades comerciales en un nuevo lago de datos centralizado y **anonimizado**, y desea transformarlo en análisis de riesgo validados — **morosidad, probabilidad de impago, información estratégica sobre políticas crediticias** — además de una **capa de información en lenguaje natural dirigida a ejecutivos**.
Se trata de una **construcción fundacional de ciencia de datos, no de un proyecto de IA basado en agentes**. Las primeras tareas son poco llamativas y requieren intervención directa: validar datos cuya fiabilidad aún nadie puede garantizar, y posteriormente construir modelos sólidos sobre dichos datos. Usted es el científico de datos senior que al cliente le falta: **realiza el trabajo y asume la responsabilidad metodológica**, liderando un pequeño equipo (pod) y actuando como **el humano en el bucle**, tal como el cliente ha solicitado expresamente.
**Etapa**: precontrato / definición del alcance (Fase 1 = evaluación del estado actual + validación de datos). **Duración**: ambición multietapa y multi-trimestral, con alta probabilidad de prórroga.
**Reporta a**: Líder de la colaboración / CTO (@Alex Honchar); lidera a los ingenieros de datos del equipo y al equipo de datos offshore del cliente.
**Se prefiere una colaboración a tiempo completo.**
**Qué hará concretamente** ***(ejemplos de tareas)***
-------------------------------------------------
* Analizar de forma práctica el lago de datos anonimizado — examinar tablas con decenas de millones de filas y **reproducir y validar las estadísticas descriptivas existentes del equipo**, de modo que cada número sea rastreable hasta su origen (actualmente, el cliente no puede responder a la pregunta *«¿cómo sabe que esto es correcto?»*).
* Construir y validar usted mismo los modelos centrales de riesgo: **probabilidad de impago (PD), morosidad / tasa de rotación, alerta temprana, segmentación y tarjetas de puntuación** (WOE / IV, regresión logística, boosting por gradiente).
* Establecer la **disciplina de validación de modelos** que garantice que los resultados sean auditables: divisiones entre conjuntos de entrenamiento / prueba / fuera de tiempo, métricas Gini / AUC / KS, calibración, estabilidad (PSI), backtesting y documentación completa del modelo.
* Definir la lógica de las variables junto con el ingeniero de datos y **implementarla usted mismo en SQL / dbt / Python**; especificar las definiciones armonizadas que debe ofrecer la capa semántica.
* Desarrollar y validar un prototipo de la **capa de información en lenguaje natural** (transformación de texto a SQL / RAG sobre la capa semántica); verificar la corrección de las respuestas y añadir salvaguardas.
* Realizar un **análisis de política crediticia / umbral de aprobación**, mostrando dónde el cliente podría endurecer su política o reducir la morosidad — una información concreta que sus propios clientes solicitan continuamente.
* Liderar un pequeño equipo (ingeniero de datos, personal junior de datos offshore del cliente): asignar tareas, revisar los trabajos realizados, establecer el estándar de calidad y actuar como el humano en el bucle.
* Interactuar con la dirección de datos del cliente: presentar hallazgos, explicar la metodología a ejecutivos no técnicos y contribuir a la definición de la hoja de ruta por fases y del alcance del trabajo (SoW).
**Competencias** ***(prioridad absoluta a la experiencia práctica)***
----------------------------------
* Conocimiento experto de **Python** para ciencia de datos (pandas / Polars, scikit-learn, statsmodels) y sólidos conocimientos de **SQL** sobre tablas grandes
* Experiencia en **modelado del riesgo crediticio / financiero**: tarjetas de puntuación, probabilidad de impago (PD), morosidad, segmentación, validación y gobernanza de modelos
* Validación y análisis exploratorio de datos, ingeniería de características y limpieza de datos empresariales complejos
* Experiencia con **dbt / modelado semántico**; colaboración con ingeniería de datos en la capa de armonización
* Capa de información basada en IA generativa: transformación de texto a SQL, RAG sobre datos estructurados, evaluación y salvaguardas
* Metodología, trazabilidad y documentación que resistan auditorías; capacidad para explicarla a ejecutivos
* Liderazgo de pequeños equipos de entrega y equipos distribuidos / offshore
**Conocimientos**
-------------
* Fundamentos del Reglamento General de Protección de Datos (RGPD) (anonimización frente a seudonimización, residencia de datos en el Reino Unido y la UE)
* Pila analítica de AWS y principios de Arquitectura Bien Diseñada (Analytics, Seguridad) para el sector financiero (BFSI)
* Contexto regulatorio del crédito y los préstamos en el Reino Unido y la UE (FCA, gobernanza de modelos, equidad y explicabilidad en el crédito) — ventaja significativa
* Familiaridad con productos de datos de agencias de crédito / scoring — ventaja significativa
**Experiencia**
--------------
Características clave (idealmente 4/4):
* Ciencia de datos práctica a escala empresarial
* Experiencia con clientes de servicios financieros / crédito o trabajo interno en una empresa de crédito / préstamos
* Experiencia con proveedores de nube (AWS preferido)
* Antecedentes en consultoría tecnológica o entrega directa al cliente
Características específicas del puesto:
* **7+ años** de experiencia práctica en ciencia de datos, con experiencia real en **modelado del riesgo crediticio / financiero**
* Experiencia **construyendo y validando modelos en un contexto regulado y sometido a auditoría**
* Liderazgo de pequeños equipos de ciencia de datos manteniendo al mismo tiempo una participación activa en la programación
* Capacidad demostrable para realizar personalmente el **trabajo manual de limpieza de datos**, y no solo dirigirlo