Descripción
Runware está construyendo infraestructura y productos de alto\-rendimiento para impulsar la inteligencia del mundo. Nuestra plataforma permite a desarrolladores y empresas ejecutar inferencias rápidas y escalables en imágenes, vídeos y nuevas modalidades emergentes, mientras que nuestra plataforma sin servidor (serverless) permite a los clientes implementar y escalar sus propios modelos de IA sobre infraestructura GPU de calidad productiva.
Como Ingeniero de Fiabilidad de Sitios (SRE) en Runware, ayudarás a garantizar que estos sistemas sigan siendo fiables, con buen rendimiento y resilientes a medida que escalamos. Se trata de un puesto altamente técnico y práctico, que abarca software, infraestructura y operaciones productivas, orientado a mejorar la observabilidad, reducir las incidencias, eliminar tareas operativas repetitivas (toil) y construir mejoras duraderas en sistemas distribuidos complejos.
Lo que harás* Serás responsable de la fiabilidad, disponibilidad y rendimiento de los servicios productivos críticos en toda la plataforma Runware, y trabajarás para mejorarlos.
* Definirás y evolucionarás nuestras prácticas de fiabilidad, incluidos los indicadores de nivel de servicio (SLI), objetivos de nivel de servicio (SLO), alertas, observabilidad y estándares de preparación para producción.
* Investigarás problemas complejos en producción que afecten a sistemas distribuidos, APIs, redes, colas, bases de datos y cargas de trabajo respaldadas por GPU, participando en nuestro turno de guardia técnica (on\-call) de ingeniería.
* Liderarás y contribuirás a revisiones de incidencias y análisis de causas raíz (RCA), transformando modos de fallo recurrentes en mejoras técnicas duraderas.
* Reducirás las tareas operativas repetitivas (toil) mediante automatización, remedios automáticos y mejoras en la seguridad de las implementaciones, la recuperación y la resiliencia del sistema.
* Colaborarás estrechamente con los equipos de Ingeniería y DevOps en planificación de capacidad, rendimiento, escalabilidad y mejoras arquitectónicas a medida que la plataforma crezca.
**Requisitos**
* Experiencia sólida gestionando y solucionando problemas en sistemas productivos a gran escala, en puestos como SRE, Ingeniero de Producción, Ingeniero de Plataforma o roles similares.
* Conocimientos profundos de sistemas distribuidos y capacidad para depurar aplicaciones, bases de datos, colas, contenedores, redes e infraestructura.
* Experiencia diseñando y operando sistemas de observabilidad mediante métricas, registros (logs) y trazado distribuido (distributed tracing).
* Comprensión de los principios de SRE, incluidos SLI, SLO, presupuestos de errores (error budgets), planificación de capacidad, gestión de incidencias y reducción de tareas operativas repetitivas (toil).
* Experiencia con Kubernetes, contenedores, infraestructura como código (IaC) y prácticas de implementación automatizada, además de capacidad para escribir software y automatizaciones en lenguajes como Python, Go o PHP.
* Sentido fuerte de propiedad ante los problemas productivos y disposición para participar en turnos de guardia técnica (on\-call) de ingeniería, llevando las incidencias desde la investigación inicial hasta la corrección a largo plazo.
Ventajas adicionales* Experiencia gestionando APIs de alto rendimiento o baja latencia y sistemas distribuidos.
* Experiencia con infraestructura bare\-metal, entornos GPU o cargas de trabajo de IA y ML.
* Experiencia con RabbitMQ u otros sistemas distribuidos de mensajería y colas.
* Experiencia operando sistemas de datos productivos como MySQL, Redis o ClickHouse.
* Experiencia con gestión global del tráfico, equilibrio de carga (load balancing), plataformas CDN y entornos híbridos de infraestructura.
* Experiencia construyendo sistemas automatizados de escalado, gestión de capacidad o autorrecuperación (self\-healing).
**Beneficios**
Somos un equipo remoto desde su origen (remote\-first), con encuentros presenciales dos veces al año para planificar, hacer lluvias de ideas, celebrar logros y disfrutar de tiempo cara a cara. Tenemos horarios centrales para colaboración y reuniones, pero fuera de ellos tu calendario es tuyo. Trabaja las horas que te permitan rendir al máximo y, al mismo tiempo, construir una vida saludable.
Nuestros ciclos de lanzamiento son rápidos e intensos, pero van seguidos de verdadero tiempo de descanso. Tras los esfuerzos más grandes, esperamos que el equipo se desconecte, recargue energías y regrese listo \& más fuerte que nunca para el siguiente avance.
* **Tiempo libre remunerado generoso** – vacaciones, días de enfermedad, festivos oficiales
* **Opciones accionarias significativas** – comparte en los beneficios que generas
* **Configuración remota desde el inicio** – trabaja desde casa en cualquier lugar donde podamos contratarte
* **Horarios flexibles** – administra tu propio horario fuera de los bloques centrales de colaboración
* **Licencias familiares** – licencia remunerada por maternidad, paternidad y cuidado de familiares
* **Retiros corporativos** – reuniones anuales dos veces al año en lugares inspiradores