Chat rápido, mejores ofertas — Descargar

Ingeniero de Confiabilidad del Sitio (SRE) Nivel Staff — Plataforma de IA

Indeed

Compañía

Tipo de empleoTiempo completo
Modalidad de trabajoHíbrido
Nivel de experiencia6 a 10 años
Nivel educativoMaestría

Descripción

### **QUIÉNES SOMOS** Manychat es una plataforma líder en marketing por chat que ayuda a las empresas a interactuar con sus clientes en Instagram, Facebook Messenger, WhatsApp y Telegram. Confían en nosotros más de 1 millón de marcas en más de 170 países; somos un socio comercial oficial de Meta y contamos con el respaldo de Bessemer Venture Partners. Con más de 400 compañeros distribuidos en nuestras oficinas de Austin, Barcelona, Ereván, São Paulo y Ámsterdam, estamos construyendo la infraestructura del comercio conversacional. **QUIÉN ESTAMOS BUSCANDO** ------------------------- ¿Quieres diseñar desde cero la arquitectura de una plataforma de IA, en lugar de limitarte a mantener lo que otros ya construyeron? Manychat implementa funciones de IA para empresas de todo el mundo, y buscamos un ingeniero de confiabilidad del sitio (SRE) que asuma la responsabilidad de la fiabilidad, el rendimiento y los costos de dicha infraestructura de IA, y que eleve el nivel de cómo toda nuestra organización de ingeniería construye sobre modelos de lenguaje de gran tamaño (LLM). Este no es un rol clásico de SRE al que se le añade un toque de IA. Necesitamos a alguien nativo en IA: ya debes comprender cómo funcionan los sistemas modernos de LLM en producción, aspectos como el rendimiento en tokens, los límites de tasa de los proveedores, la degradación de la calidad de los modelos y las colas de latencia de inferencia, y debes tratar todos estos factores como una preocupación fundamental de fiabilidad, no como una consideración secundaria. Por qué este puesto merece tu tiempo: * La Plataforma de IA aún está en una etapa temprana, así que podrás definir su arquitectura, estándares y hoja de ruta desde sus fundamentos. * Las consecuencias son reales. Las funciones de IA están ubicadas directamente en la ruta crítica de la automatización orientada al cliente, por lo que tu trabajo tiene un impacto real en el negocio, no solo en un panel de control. * Colaborarás directamente con el Director de Infraestructura, con autonomía real y visibilidad sobre cómo se materializan tus decisiones. ¿Suena como el tipo de responsabilidad que has estado buscando? **LO QUE HARÁS** ------------------ * Asumir la responsabilidad de la fiabilidad y el rendimiento de nuestra infraestructura de IA: Puerta de Enlace de IA, servicios de inferencia e integraciones con Amazon Bedrock, Azure OpenAI y otros proveedores de LLM. * Diseñar y evolucionar la Puerta de Enlace de IA: enrutamiento, conmutación por error entre proveedores, limitación de tasas, almacenamiento en caché y salvaguardias. * Desarrollar capacidades de observabilidad para sistemas de IA: objetivos de nivel de servicio (SLO) de latencia, rendimiento y errores por modelo y proveedor, métricas a nivel de token, señales de calidad y derivación. * Impulsar la optimización de costos y la gestión financiera de cargas de trabajo de IA (FinOps): visibilidad de costos por función, ajuste adecuado del tamaño de los modelos, estrategias de almacenamiento en caché y combinación de proveedores. * Realizar la planificación de capacidad y la respuesta ante incidentes para los servicios de inferencia; redactar y mejorar manuales operativos y análisis posteriores a incidentes. * Escalar el conocimiento especializado en IA dentro de la organización: establecer estándares, revisar diseños y asesorar a equipos que lanzan funciones impulsadas por LLM. **REQUISITOS PARA DESTACAR EN ESTE ROL** ------------------------- Necesitarás: * 5 o más años de experiencia en ingeniería de confiabilidad del sitio (SRE), ingeniería de plataformas o infraestructura, incluida la responsabilidad operativa en entornos de escala significativa. * Experiencia práctica operando sistemas basados en LLM en producción: APIs de proveedores (Bedrock, OpenAI, Anthropic o similares), tuberías de inferencia, servicios de modelos alojados de forma independiente o gestionados. * Amplia experiencia nativa en la nube: AWS, Kubernetes, Terraform/IaC, CI/CD. * Práctica sólida en observabilidad (Prometheus/Grafana, OpenTelemetry o equivalente) y experiencia definiendo SLO para sistemas no deterministas. * Experiencia demostrable en optimización de costos: debes poder mostrar dónde redujiste gastos en la nube o en inferencia, y cómo hiciste visibles dichos costos. * Influencia a nivel Staff: has definido la dirección técnica más allá de tu propio equipo y has logrado alinear a otros. Sería ideal si cuentas con: * Experiencia desarrollando u operando una puerta de enlace/proxy para LLM (por ejemplo, LiteLLM, Kong AI Gateway o personalizada). * Experiencia en optimización de cargas de trabajo GPU, cuantización o frameworks de servicio (vLLM, TGI, Triton). * Experiencia con tuberías de evaluación y monitoreo de calidad de las salidas de LLM. **Por qué este puesto** ----------------- * Responsabilidad en un entorno sin precedentes: la Plataforma de IA es reciente; tú definirás su arquitectura, estándares y hoja de ruta. * Escala real y consecuencias reales: las funciones de IA forman parte integral de la ruta crítica de la automatización orientada al cliente. * Colaboración directa con el Director de Infraestructura; alta autonomía y visibilidad. **LO QUE OFRECEMOS** ----------------- Nos preocupamos profundamente por tu crecimiento, bienestar y comodidad: * Incorporación híbrida para comenzar a trabajar de forma remota y apoyo para la reubicación, tanto para ti como para tu familia. * Seguro médico integral tanto para ti como para tu familia. * Presupuesto para desarrollo profesional destinado a entradas para conferencias, cursos en línea y otros recursos relevantes que te ayuden a crecer. * Paquete de beneficios flexibles: aquí no existen beneficios únicos para todos. Recibes un presupuesto y decides cómo utilizarlo, ya sea para salud y bienestar, familia o equipamiento de tu oficina en casa. * Trabajo híbrido y licencias flexibles y generosas — planificadas de forma colaborativa con tu equipo, no asignadas mediante cuotas rígidas. * Beneficios en la oficina, incluidas comidas y refrigerios gratuitos. * Actividades deportivas financiadas por la empresa, eventos anuales fuera de la oficina y actividades de cohesión del equipo. * La IA no es un beneficio adicional aquí: es parte fundamental de nuestro modo de trabajar. Claude, OpenAI y otras herramientas están activas por defecto desde el primer día, y apoyamos a los equipos para adoptar aquellas que les permitan ser más eficientes. *Manychat es un empleador que ofrece igualdad de oportunidades. Estamos comprometidos con la construcción de un equipo diverso e inclusivo. No discriminamos a empleados ni candidatos calificados por motivos de raza, color, religión, identidad de género, sexo, preferencia sexual, identidad sexual, embarazo, origen nacional, ascendencia, ciudadanía, edad, estado civil, discapacidad física, discapacidad mental, condición médica, estatus militar o cualquier otra característica protegida por la ley o normativa local.* *Este compromiso también se refleja en la experiencia de los candidatos. Si tienes necesidades particulares que puedan requerir adaptaciones durante el proceso de entrevista, indícalo en tu solicitud. Haremos todo lo posible por brindarte asistencia durante todo el proceso de entrevista para asegurarnos de que estés en óptimas condiciones para tener éxito.*

Fuentea: indeed
Parte del contenido se ha traducido automáticamente

Publicado por

David Muñoz

Indeed · HR

Ubicación

David Muñoz

Indeed · HR

Empleos similares

Ingeniero de Confiabilidad del Sitio (SRE) Nivel Staff — Plataforma de IA empleo de Indeed en 2026 | ok.com