Descripción
### **QUIÉNES SOMOS**
Manychat es una plataforma líder de marketing mediante chat que ayuda a las empresas a interactuar con sus clientes en Instagram, Facebook Messenger, WhatsApp y Telegram. Confían en nosotros más de 1 millón de marcas en más de 170 países; somos un Partner Oficial de Negocios de Meta, respaldado por Bessemer Venture Partners. Con más de 400 compañeros en nuestras oficinas de Austin, Barcelona, Ereván, São Paulo y Ámsterdam, estamos construyendo la infraestructura del comercio conversacional.
**A QUIÉN BUSCAMOS**
-------------------------
¿Quieres diseñar desde cero la arquitectura de una plataforma de IA, en lugar de limitarte a mantener lo que otros ya construyeron?
Manychat ofrece funciones de IA para empresas de todo el mundo, y buscamos un ingeniero de fiabilidad de sitios (SRE) que asuma la responsabilidad de la fiabilidad, el rendimiento y los costos de dicha infraestructura de IA, además de elevar el nivel de cómo toda nuestra organización de ingeniería construye sobre modelos de lenguaje de gran tamaño (LLM).
Este no es un rol clásico de SRE al que se le ha añadido un toque de IA. Necesitamos a alguien nativo en IA: ya debes comprender cómo se comportan los sistemas modernos de LLM en producción, aspectos como el rendimiento de tokens, los límites de tasa de los proveedores, la degradación de la calidad del modelo y las colas de latencia en la inferencia, y debes tratar todo ello como una preocupación primaria de fiabilidad, no como una reflexión posterior.
Por qué este puesto merece tu tiempo:
* La Plataforma de IA aún es joven, por lo que tú definirás su arquitectura, estándares y hoja de ruta desde sus cimientos.
* Las apuestas son reales. Las funciones de IA se encuentran directamente en la ruta crítica de la automatización orientada al cliente, así que tu trabajo realmente impacta en el negocio, no solo en un panel de control.
* Colaborarás directamente con el Director de Infraestructura, con auténtoma autonomía y visibilidad real sobre cómo se materializan tus decisiones.
¿Suena como el tipo de responsabilidad que llevas tiempo buscando?
**LO QUE HARÁS**
------------------
* Asumir la responsabilidad de la fiabilidad y el rendimiento de nuestra infraestructura de IA: Puerta de Enlace de IA, servicios de inferencia e integraciones con Amazon Bedrock, Azure OpenAI y otros proveedores de LLM.
* Diseñar y evolucionar la Puerta de Enlace de IA: enrutamiento, conmutación por error entre proveedores, limitación de tasas, almacenamiento en caché y salvaguardias.
* Construir observabilidad para sistemas de IA: objetivos de nivel de servicio (SLO) de latencia, rendimiento y errores por modelo y proveedor, métricas a nivel de token, señales de calidad y derivación.
* Impulsar la optimización de costos y la gestión financiera de cargas de trabajo de IA: visibilidad de costos por función, ajuste adecuado del tamaño de los modelos, estrategias de almacenamiento en caché y combinación de proveedores.
* Realizar planificación de capacidad y respuesta ante incidencias para los servicios de inferencia; redactar y mejorar manuales operativos y análisis posteriores a incidentes.
* Escalar la experiencia en IA en toda la organización: establecer estándares, revisar diseños y capacitar a los equipos que lanzan funciones basadas en LLM.
**PARA DESTACAR EN ESTE ROL**
-------------------------
Necesitarás:
* 5 o más años de experiencia en ingeniería de SRE / plataformas / infraestructura, incluida la responsabilidad operativa en producción a gran escala.
* Experiencia práctica gestionando sistemas basados en LLM en producción: APIs de proveedores (Bedrock, OpenAI, Anthropic o similares), tuberías de inferencia, alojamiento propio o servicios gestionados de modelos.
* Amplia experiencia en entornos nativos de la nube: AWS, Kubernetes, Terraform/IaC, CI/CD.
* Práctica sólida en observabilidad (Prometheus/Grafana, OpenTelemetry o equivalente) y experiencia definiendo SLO para sistemas no deterministas.
* Experiencia comprobada en optimización de costos: deberás demostrar dónde redujiste gastos en la nube o en inferencia y cómo hiciste visibles dichos costos.
* Influencia a nivel de Staff: ya has definido la dirección técnica más allá de tu propio equipo y has logrado que otros lo sigan.
Sería muy valioso si tienes:
* Experiencia desarrollando u operando una puerta de enlace/proxy para LLM (por ejemplo, LiteLLM, Kong AI Gateway o personalizada).
* Experiencia en optimización de cargas de trabajo GPU, cuantización o frameworks de servicio (vLLM, TGI, Triton).
* Experiencia con tuberías de evaluación y monitoreo de calidad de las salidas de LLM.
**Por qué este rol**
-----------------
* Responsabilidad en un entorno virgen: la Plataforma de IA es joven; tú definirás su arquitectura, estándares y hoja de ruta.
* Escala real y apuestas reales: las funciones de IA se encuentran en la ruta crítica de la automatización orientada al cliente.
* Colaboración directa con el Director de Infraestructura; alta autonomía y visibilidad.
**LO QUE OFRECEMOS**
-----------------
Nos importa profundamente tu crecimiento, bienestar y comodidad:
* Incorporación híbrida para comenzar a trabajar de forma remota y apoyo para la reubicación, tanto para ti como para tu familia.
* Seguro médico integral tanto para ti como para tu familia.
* Presupuesto para desarrollo profesional destinado a entradas para conferencias, cursos en línea y otros recursos relevantes que te ayuden a crecer.
* Paquete de beneficios flexibles: aquí no existen beneficios únicos para todos. Recibes un presupuesto y decides cómo gastarlo, ya sea en salud y bienestar, familia o equipamiento para tu oficina en casa.
* Trabajo híbrido y permisos flexibles y generosos — planificados con tu equipo, no asignados mediante una cuota rígida.
* Beneficios en la oficina, incluidas comidas y refrigerios gratuitos.
* Actividades deportivas financiadas por la empresa, eventos anuales fuera de la oficina y actividades de cohesión del equipo.
* La IA no es un beneficio adicional aquí: es la forma en que trabajamos. Claude, OpenAI y más están activos por defecto desde el primer día, y apoyamos a los equipos en la adopción de cualquier herramienta que los haga más rápidos.
*Manychat es un empleador que ofrece igualdad de oportunidades. Estamos comprometidos con la construcción de un equipo diverso e inclusivo. No discriminamos a empleados ni candidatos calificados por motivos de raza, color, religión, identidad de género, sexo, preferencia sexual, identidad sexual, embarazo, origen nacional, ascendencia, ciudadanía, edad, estado civil, discapacidad física, discapacidad mental, condición médica, condición militar o cualquier otra característica protegida por la ley o normativa local.*
*Este compromiso también se refleja en la experiencia del candidato. Si tienes necesidades particulares que puedan requerir adaptaciones durante el proceso de entrevista, indícalo en tu solicitud. Haremos todo lo posible por brindarte asistencia durante todo el proceso de entrevista para asegurarnos de que estés completamente preparado para tener éxito.*