Descripción
**Descripción de la empresa**
Mirantis es la empresa especializada en infraestructura de IA nativa de Kubernetes, que permite a las organizaciones construir y operar infraestructuras escalables, seguras y soberanas para aplicaciones modernas de IA, aprendizaje automático y procesamiento intensivo de datos. Al combinar la innovación de código abierto con una profunda experiencia en la orquestación de Kubernetes, Mirantis capacita a los equipos de ingeniería de plataformas para ofrecer plataformas para desarrolladores modulares y listas para producción en cualquier entorno: local, en la nube, en el borde o en centros de datos soberanos. A medida que las empresas afrontan la creciente complejidad de las cargas de trabajo impulsadas por la IA, Mirantis ofrece la automatización, la orquestación de GPU y el control basado en políticas necesarios para gestionar la infraestructura con confianza y agilidad. Comprometida con los estándares abiertos y la libertad frente al bloqueo tecnológico, Mirantis garantiza que los clientes conserven un control total sobre su estrategia de infraestructura.
Mirantis atiende a muchas de las principales empresas mundiales, incluidas Adobe, DocuSign, Liberty Mutual, PayPal, Reliance Jio, Societe Generale, Splunk y Volkswagen. Más información en www.mirantis.com.
**Descripción del puesto**
Estamos formando un equipo europeo de Infraestructura de IA y Operaciones de Plataforma encargado de operar entornos de infraestructura de IA a gran escala impulsados por GPUs NVIDIA, redes de alto rendimiento, Kubernetes y tecnologías de plataforma de próxima generación.
Como Ingeniero Senior de Infraestructura de IA y Operaciones de Plataforma, desempeñará un papel de liderazgo técnico dentro de la organización de operaciones, aportando una profunda experiencia en infraestructura, redes, operaciones de plataforma y fiabilidad de servicios. Será responsable de impulsar la excelencia operativa en entornos de producción complejos, actuando como punto clave de escalación para incidentes críticos y problemas técnicos desafiantes.
Este puesto combina operaciones técnicas prácticas con liderazgo técnico, ayudando a definir estándares operativos, prácticas de fiabilidad, iniciativas de automatización y la evolución futura de los servicios operativos impulsados por IA mediante plataformas como k0rdent AI.
**Responsabilidades:**
**Operaciones técnicas y fiabilidad de servicios**
* Dirigir la investigación y resolución de incidentes complejos relacionados con infraestructura, redes y plataformas.
* Actuar como punto de escalación senior para los equipos operativos durante eventos críticos que afecten al servicio.
* Apoyar infraestructuras de GPU NVIDIA a gran escala y entornos de red de alto rendimiento.
* Diagnosticar problemas complejos relacionados con Linux, Kubernetes, redes, almacenamiento y hardware.
* Analizar tendencias de rendimiento, capacidad, estabilidad y fiabilidad de la plataforma para identificar proactivamente riesgos.
* Dirigir actividades de análisis de causa raíz e impulsar acciones correctivas a largo plazo.
* Colaborar con equipos de ingeniería, proveedores de hardware y personal de centros de datos para resolver desafíos técnicos complejos.
* Participar en la gestión de incidentes mayores y en las actividades de restauración del servicio.
**Operaciones y ingeniería de plataformas**
* Proporcionar liderazgo técnico en las operaciones de plataformas Kubernetes y en los servicios de infraestructura de apoyo.
* Impulsar mejoras en la fiabilidad, observabilidad, supervisión y procesos operativos de la plataforma.
* Identificar oportunidades para automatizar actividades operativas repetitivas y mejorar la eficiencia operativa.
* Contribuir a revisiones de preparación operativa, cambios en la infraestructura, actualizaciones y lanzamientos de nuevos servicios.
* Apoyar la adopción y operación de servicios de infraestructura y capacidades operativas impulsadas por IA mediante k0rdent AI.
* Evaluar tecnologías emergentes y prácticas operativas para mejorar la prestación de servicios y la resiliencia de la plataforma.
**Liderazgo técnico**
* Mentorizar y apoyar a los ingenieros de Infraestructura de IA y Operaciones de Plataforma.
* Compartir conocimientos técnicos mediante documentación, sesiones formativas y revisiones operativas.
* Desarrollar y mantener estándares operativos, manuales de procedimientos, guías de resolución de incidencias y buenas prácticas.
* Ayudar a definir procesos operativos, rutas de escalación y estándares de fiabilidad de servicios.
* Actuar como asesor técnico de confianza durante la planificación operativa y las iniciativas de mejora de servicios.
**Requisitos** **Habilidades y experiencia requeridas:**
* 7 años o más de experiencia en operaciones de infraestructura, operaciones de plataforma, ingeniería de fiabilidad de sitios (SRE), operaciones de redes, operaciones en la nube, operaciones en centros de datos o funciones técnicas afines.
* Conocimientos expertos en administración y resolución de incidencias de Linux.
* Amplia experiencia en redes, incluida la capacidad de diagnosticar problemas complejos de rendimiento, conectividad y fiabilidad.
* Experiencia sólida en la operación de Kubernetes en entornos productivos.
* Experiencia en el soporte de infraestructuras productivas a gran escala y sistemas distribuidos.
* Experiencia demostrada liderando investigaciones técnicas y gestionando incidentes complejos.
* Experiencia realizando análisis de causa raíz e impulsando mejoras operativas a largo plazo.
* Conocimientos sólidos sobre observabilidad, supervisión y prácticas de fiabilidad de servicios.
* Excelentes habilidades analíticas y de resolución de problemas en múltiples dominios de infraestructura.
* Excelentes habilidades de comunicación, colaboración y gestión de partes interesadas.
**Es muy deseable contar con experiencia en uno o varios de los siguientes ámbitos:**
* Infraestructura de GPU NVIDIA y plataformas de computación acelerada.
* Redes InfiniBand y NVIDIA UFM.
* Entornos de infraestructura de IA.
* Entornos de computación de alto rendimiento (HPC).
* Ingeniería de plataformas o ingeniería de fiabilidad de sitios (SRE).
* Operaciones de Kubernetes a gran escala.
* Tecnologías de automatización de infraestructura y prácticas de Infraestructura como Código (IaC).
* Plataformas de observabilidad como Grafana, Prometheus, ELK u OpenTelemetry.
* Análisis y optimización del rendimiento de plataformas de infraestructura distribuida.
* Liderazgo técnico, mentoría o responsabilidades como líder de equipo.
**Información adicional** **Ofrecemos:**
* Operar algunos de los entornos de infraestructura de IA más avanzados en producción actualmente.
* Trabajar con las últimas tecnologías de GPU NVIDIA, plataformas Kubernetes y entornos de red de alto rendimiento.
* Contribuir a la definición de estándares operativos y prácticas de fiabilidad para servicios de infraestructura de IA de próxima generación.
* Influenciar la adopción de capacidades operativas impulsadas por IA mediante k0rdent AI.
* Trabajar junto a ingenieros altamente cualificados que resuelven desafíos complejos de infraestructura y plataforma a escala.
* Unirse a una organización en crecimiento que invierte fuertemente en infraestructura de IA, servicios de plataforma e innovación operativa.
\#Remoto
¡Somos Líder en Gestión de Contenedores según G2 (n.º 2 tras AWS)!