Descripción
**Acerca del proyecto** ***(descripción, duración, fase)***
----------------------------------------------------------
Únase a Neurons Lab como **Ingeniero de Datos** (a tiempo parcial) en un proyecto destacado con un **grupo europeo de inversión privada** — una sociedad holding con un equipo ejecutivo de alto nivel, una función de inversión/cartera y una oficina familiar afiliada.
El programa construye una única capa de **contexto privada y con ámbito de acceso** sobre los datos del grupo, y luego habilidades de IA y agentes encima de ella. Usted construye la infraestructura subyacente: **Fase 1 (Captura)** — activar la ingesta desde llamadas, correo electrónico, Slack y mensajería instantánea, actas de juntas, presentaciones y actualizaciones de cartera, tanto en tiempo real como históricas; **Fase 2 (Conexión)** — depositar todo ello en la capa de contexto con identidad resuelta, ámbito de acceso adjunto y trazabilidad intacta.
Este es deliberadamente un **rol de ingeniería de datos centrado primero en datos no estructurados**. No hay un almacén limpio que modelar: el material bruto son transcripciones, hilos de conversación, archivos adjuntos y años de archivo, y los problemas difíciles son la resolución de entidades entre personas y organizaciones, la desduplicación, la sincronización incremental, el manejo de datos personales identificables (PII) y el control de costes a gran volumen.
Aproximadamente **entre ocho y diez sprints de dos semanas**, con su carga **concentrada al principio, en las primeras cuatro o cinco semanas** — la asignación puede superar 0,5 FTE durante las fases de Captura y Conexión y luego reducirse posteriormente.
**Fase**: precontrato / negociación como socio de diseño.
**Reporta a**: el Arquitecto de IA del proyecto, trabajando junto a un Analista de IA; el Director de Seguridad del cliente forma parte del grupo de trabajo desde el primer día.
**Contrato a tiempo parcial, dedicación de 20 horas semanales.**
**Qué hará concretamente** ***(tareas ejemplares)***
-------------------------------------------------
* Implementar la **captura por defecto**: tomador de notas en todas las llamadas con atribución de hablantes, además de ingesta desde correo, Slack y mensajería instantánea — diseñado como opción de exclusión (opt-out), no de inclusión (opt-in), y reversible si el cliente cambia de opinión.
* **Rellenar el archivo histórico**: años de correos electrónicos históricos, mensajes de Slack, actas de juntas, presentaciones y actualizaciones de cartera — analizados, desduplicados y fechados correctamente.
* Desarrollar **análisis de documentos** para el largo y complejo tail: PDF, paquetes de juntas escaneados, hojas de cálculo, presentaciones y archivos adjuntos reenviados.
* Implementar **resolución de identidad / entidades**: la misma persona a través de su identificador en Slack, alias de correo y invitación de calendario; la misma empresa de cartera a través de una presentación, un hilo de correo y un registro en el CRM.
* Construir **tuberías de fragmentación (chunking) e incrustación (embedding)** y cargar las bases de datos vectoriales y de grafos detrás de la ontología definida por el arquitecto.
* Implementar **sincronización incremental** a través de la capa de conectores (tipo MCP / Composio) — sin reconstrucciones completas, sin derivación silenciosa y con manejo claro de ediciones y eliminaciones.
* Adjuntar **ámbito de acceso y procedencia a cada registro en el momento de la ingesta**, para permitir recuperación y auditoría conscientes de permisos en etapas posteriores, en lugar de añadirlas como parches.
* Ejecutar lógica de **detección, enmascaramiento y retención de PII**; proporcionar evidencia a la función de seguridad del cliente sobre qué se almacena, dónde y durante cuánto tiempo.
* Orquestar con **Airflow / Step Functions**; construir **tuberías repetibles y monitorizadas**, no simples scripts, con alertas cuando una fuente deja de fluir.
* Mantener **los costes y la latencia bajo control a gran volumen** — agrupación (batching), incrustación incremental, escalonamiento de almacenamiento — y reportar la economía unitaria.
* Redactar **manuales operativos (runbooks)** para que el equipo propio del cliente pueda operar este sistema tras la entrega.
**Habilidades**
----------
* Fuerte dominio de **Python** y sólidos conocimientos de **SQL**
* **Tuberías de datos no estructurados**: transcripciones, correo, chat, documentos — análisis, normalización, desduplicación
* **Infraestructura de incrustación y recuperación**: estrategias de fragmentación (chunking), bases de datos vectoriales (pgvector, OpenSearch, tipo Pinecone), además de carga en bases de datos de grafos
* **Integración de APIs y conectores** a gran escala: Google Workspace / M365, Slack, CRM; límites de tasa, paginación, cursores incrementales, webhooks
* **Resolución de entidades / vinculación de registros** (determinista y difusa) sin una clave compartida limpia
* **Orquestación**: Airflow, Step Functions o equivalente; trabajos idempotentes y reiniciables
* Pila de datos en **AWS y/o GCP**; comodidad operativa en despliegues privados / VPC
* **Detección, enmascaramiento, cifrado y retención de PII** en la práctica
* Excelente dominio escrito del inglés; documentación para la entrega y buen funcionamiento asíncrono en un pequeño equipo distribuido
**Conocimientos**
-------------
* Aplicación del **Reglamento General de Protección de Datos (RGPD)** a los datos generados por empleados (correo, chat, grabaciones de reuniones) y residencia de datos en la UE a través de múltiples jurisdicciones
* Patrones de **trazabilidad (lineage), procedencia y auditoría de datos** — y por qué un sistema de IA los necesita más, no menos
* Cómo la **calidad de la recuperación depende de la calidad de la ingesta** — comprensión suficiente de RAG para tomar las decisiones adecuadas en etapas anteriores
* Buenas prácticas de **seguridad y costes según el modelo Well-Architected**; conocimiento de las expectativas del sector financiero — un valor añadido
**Experiencia**
--------------
* **Más de 4 años** en ingeniería de datos, con experiencia real en trabajo con datos **no estructurados o semiestructurados** (no solo modelado de almacenes)
* Experiencia demostrable **integrando múltiples APIs de terceros** en un único repositorio coherente, incluyendo rellenado histórico
* Experiencia construyendo tuberías que alimentan un **sistema de LLM / recuperación** — muy valorado
* Experiencia gestionando **datos personales sensibles** en entornos regulados o con altos requisitos de seguridad
* Capacidad para ser el **único ingeniero de datos** en un pequeño equipo (2,5 FTE), con dedicación a tiempo parcial y sin supervisión constante