Descripción
Acerca de EveryWatch
EveryWatch es la fuente de datos más grande y confiable del mercado secundario de relojes. Fundada por un grupo de entusiastas de los relojes, EveryWatch surgió en respuesta a la creciente popularidad de las piezas de relojería de lujo, con el objetivo de aportar una transparencia y conocimiento sin precedentes al mercado de relojes. Como primera plataforma de su tipo, EveryWatch integra todos los aspectos del mundo relojero bajo un mismo techo: una tienda única para coleccionistas, vendedores y aficionados.
Descripción del puesto
Buscamos un Ingeniero Senior de IA, Agentes —un Arquitecto de Agentes que se encargue de diseñar, construir y escalar soluciones impulsadas por IA en EveryWatch. Trabajando estrechamente con nuestros equipos de ingeniería, producto, ventas y datos, identificará oportunidades donde la IA y los modelos de lenguaje de gran tamaño (LLM) puedan automatizar procesos complejos, mejorar la toma de decisiones y crear nuevas capacidades para nuestros usuarios y equipos internos.
Se trata de un puesto altamente práctico, dirigido a alguien que combine sólidas habilidades de ingeniería en Python y LLM con una mentalidad creativa y proactiva. No se le proporcionará simplemente una hoja de ruta. Se espera que comprenda cómo opera la empresa, identifique dónde la IA puede marcar una diferencia significativa, proponga nuevas soluciones y las lleve desde la idea hasta la producción.
Nuestro trabajo actual en IA, incluido WatchChat, constituye una base sobre la cual construir. Ahora la oportunidad consiste en ampliar esa base hacia un ecosistema más amplio de agentes inteligentes capaces de trabajar con los datos únicos del mercado de relojes de EveryWatch y apoyar a coleccionistas, distribuidores, equipos de ventas, operaciones de datos e ingeniería.
En resumen, buscamos a alguien que no solo pregunte: **«¿Qué podemos construir?»**, sino también: **«¿Qué deberíamos construir?»**
**Requisitos**
Lo que harás realmente* Inventar la hoja de ruta de agentes. Reunirte con los equipos de ventas, datos y producto, identificar el trabajo experto repetitivo y regresar con una lista clasificada de agentes dignos de construir —con una visión realista sobre viabilidad, coste e impacto. Este es el núcleo del puesto, y no cesa tras el primer trimestre.
* Construirlos tú mismo. Eres profundamente práctico. Diseñas la arquitectura y escribes el código —herramientas, bucles, subagentes, memoria, estado, evaluación. No eres un redactor de especificaciones con un equipo bajo tu mando.
* Ser responsable de la plataforma que sustenta a los agentes. Cada nuevo agente debe ser más económico de construir que el anterior: capa compartida de herramientas sobre los datos de EverWatch (precios, subastas, listados, referencias, carteras), superficie MCP sobre nuestro backend existente, memoria compartida, trazado y un marco de evaluación reutilizable.
* Reforzar WatchChat junto con nosotros. Estado y memoria multi-turno, latencia, coste, fiabilidad en llamadas a herramientas, puertas de control de regresión. Está en producción y debe seguir funcionando correctamente.
* Hacer que la calidad sea medible. Conjuntos de datos dorados multi-turno, verificadores programáticos para la corrección de herramientas/argumentos, uso de LLM como juez sobre conjuntos reservados. Si no podemos medir un agente, no lo lanzamos.
* Tratar el coste y la latencia como restricciones de diseño. Modelos económicos para enrutamiento e intención, modelos potentes donde justifiquen su coste; presupuestos de contexto, caché y —donde resulte rentable— ajuste fino (SFT/LoRA sobre trayectorias de producción curadas) en lugar de prompts cada vez más extensos.
Qué buscamos
Tres cosas, y no renunciaremos a ninguna de ellas:
* Creatividad. Generas ideas de agentes que el negocio no había considerado, y puedes distinguir entre una que funcionará y otra que solo impresionará en una demostración. Partes de un caso de uso, no de un marco tecnológico.
* Fuerte capacidad de arquitecto. Puedes diseñar una plataforma de agentes que siga vigente dentro de cinco años —estado, memoria, límites de herramientas, descomposición en subagentes, evaluación, modos de fallo, coste. En la entrevista se te pedirá que critiques nuestra arquitectura actual, y esperamos que encuentres puntos de mejora.
* Profunda implicación práctica. Entregas resultados. Experiencia real en producción, escribiendo tú mismo el código, a buen ritmo.
Imprescindible* 6 o más años entregando software en producción, de los cuales al menos 2 en sistemas LLM utilizados por usuarios reales.
* Experiencia real en agentes: bucles ReAct o equivalentes, llamadas a funciones/herramientas, planificadores, estado y puntos de control, memoria a largo plazo, pasos HITL (human-in-the-loop), transmisión en tiempo real. No basta con decir «llamé a la API de OpenAI».
* Experiencia práctica con LangGraph (o una argumentación sólida a favor de otra alternativa), además de una pila de trazado/observabilidad —LangSmith, Langfuse o similar.
* Python en producción: FastAPI, procesamiento asíncrono de tareas, límites claros entre servicios.
* RAG bien implementado: recuperación + reordenación + juicio de relevancia, y evaluación honesta de los tres componentes.
* Evaluación como hábito, no como añadido tardío (RAGAS/DeepEval/GEVAL, LLM como juez, pass@k).
* Experiencia en producción en la nube —AWS (Bedrock, SQS, EC2/EKS, S3) o equivalente— con Docker y CI/CD.
* Capacidad crítica firme. Queremos expresamente a alguien que pregunte «¿por qué lo construyeron así?».
Deseable* Ajuste posterior al entrenamiento de LLM: SFT con LoRA/QLoRA, métodos de preferencia/aprendizaje por refuerzo, diseño de recompensas y verificadores.
* Agentes de voz (LiveKit/Pipecat o similares), o trabajo con visión y lenguaje.
* Orquestación multiagente e integraciones MCP.
* Conversión texto-a-SQL sobre un esquema de producción real y complejo.
* Agentes generadores de informes/documentos —salida estructurada, con fuentes citadas y lista para clientes.
* Mecanismos de protección (guardrails), manejo de información personal identificable (PII), detección de alucinaciones y puntuación de riesgos.
* Interés por relojes, objetos de colección o datos de mercado. No es obligatorio —basta con curiosidad por el dominio.
**Beneficios**
Qué obtienes* Propiedad total de la capa de agentes de EverWatch y de su hoja de ruta —no una pequeña parte del trabajo de otra persona.
* Un conjunto de datos que no existe en ningún otro lugar y usuarios que valoran que la respuesta sea correcta.
* Acceso directo al CTO; decisiones en días, no en trimestres.
* Presupuesto para modelos, herramientas y los agentes de programación con los que deseas trabajar.
* Compensación competitiva, enfoque remoto.