Chat rápido, mejores ofertas — Descargar

Ingeniero Senior de Infraestructura de IA y Operaciones de Plataforma (trabajo remoto en la UE)

Indeed

Compañía

Tipo de empleoTiempo completo
Modalidad de trabajoRemoto
Nivel de experienciaMás de 10 años
Nivel educativoSin requisito de título

Descripción

**Descripción de la empresa** Mirantis es la empresa especializada en infraestructura de IA nativa de Kubernetes, que permite a las organizaciones construir y operar infraestructuras escalables, seguras y soberanas para aplicaciones modernas de IA, aprendizaje automático y procesamiento intensivo de datos. Al combinar la innovación de código abierto con una profunda experiencia en la orquestación de Kubernetes, Mirantis capacita a los equipos de ingeniería de plataformas para ofrecer plataformas para desarrolladores modulares y listas para producción en cualquier entorno: local, en la nube, en el borde o en centros de datos soberanos. A medida que las empresas afrontan la creciente complejidad de las cargas de trabajo impulsadas por la IA, Mirantis ofrece la automatización, la orquestación de GPU y el control basado en políticas necesarios para gestionar la infraestructura con confianza y agilidad. Comprometida con los estándares abiertos y la libertad frente al bloqueo tecnológico, Mirantis garantiza que los clientes conserven un control total sobre su estrategia de infraestructura. Mirantis atiende a muchas de las principales empresas mundiales, incluidas Adobe, DocuSign, Liberty Mutual, PayPal, Reliance Jio, Societe Generale, Splunk y Volkswagen. Más información en www.mirantis.com. **Descripción del puesto** Estamos formando un equipo europeo de Infraestructura de IA y Operaciones de Plataforma encargado de operar entornos de infraestructura de IA a gran escala impulsados por GPUs NVIDIA, redes de alto rendimiento, Kubernetes y tecnologías de plataforma de próxima generación. Como Ingeniero Senior de Infraestructura de IA y Operaciones de Plataforma, desempeñará un papel de liderazgo técnico dentro de la organización de operaciones, aportando una profunda experiencia en infraestructura, redes, operaciones de plataforma y fiabilidad de servicios. Será responsable de impulsar la excelencia operativa en entornos de producción complejos, actuando como punto clave de escalación para incidentes críticos y problemas técnicos desafiantes. Este puesto combina operaciones técnicas prácticas con liderazgo técnico, ayudando a definir estándares operativos, prácticas de fiabilidad, iniciativas de automatización y la evolución futura de los servicios operativos impulsados por IA mediante plataformas como k0rdent AI. **Responsabilidades:** **Operaciones técnicas y fiabilidad de servicios** * Dirigir la investigación y resolución de incidentes complejos relacionados con infraestructura, redes y plataformas. * Actuar como punto de escalación senior para los equipos operativos durante eventos críticos que afecten al servicio. * Apoyar infraestructuras de GPU NVIDIA a gran escala y entornos de red de alto rendimiento. * Diagnosticar problemas complejos relacionados con Linux, Kubernetes, redes, almacenamiento y hardware. * Analizar tendencias de rendimiento, capacidad, estabilidad y fiabilidad de la plataforma para identificar proactivamente riesgos. * Dirigir actividades de análisis de causa raíz e impulsar acciones correctivas a largo plazo. * Colaborar con equipos de ingeniería, proveedores de hardware y personal de centros de datos para resolver desafíos técnicos complejos. * Participar en la gestión de incidentes mayores y en las actividades de restauración del servicio. **Operaciones y ingeniería de plataformas** * Proporcionar liderazgo técnico en las operaciones de plataformas Kubernetes y en los servicios de infraestructura de apoyo. * Impulsar mejoras en la fiabilidad, observabilidad, supervisión y procesos operativos de la plataforma. * Identificar oportunidades para automatizar actividades operativas repetitivas y mejorar la eficiencia operativa. * Contribuir a revisiones de preparación operativa, cambios en la infraestructura, actualizaciones y lanzamientos de nuevos servicios. * Apoyar la adopción y operación de servicios de infraestructura y capacidades operativas impulsadas por IA mediante k0rdent AI. * Evaluar tecnologías emergentes y prácticas operativas para mejorar la prestación de servicios y la resiliencia de la plataforma. **Liderazgo técnico** * Mentorizar y apoyar a los ingenieros de Infraestructura de IA y Operaciones de Plataforma. * Compartir conocimientos técnicos mediante documentación, sesiones formativas y revisiones operativas. * Desarrollar y mantener estándares operativos, manuales de procedimientos, guías de resolución de incidencias y buenas prácticas. * Ayudar a definir procesos operativos, rutas de escalación y estándares de fiabilidad de servicios. * Actuar como asesor técnico de confianza durante la planificación operativa y las iniciativas de mejora de servicios. **Requisitos** **Habilidades y experiencia requeridas:** * 7 años o más de experiencia en operaciones de infraestructura, operaciones de plataforma, ingeniería de fiabilidad de sitios (SRE), operaciones de redes, operaciones en la nube, operaciones en centros de datos o funciones técnicas afines. * Conocimientos expertos en administración y resolución de incidencias de Linux. * Amplia experiencia en redes, incluida la capacidad de diagnosticar problemas complejos de rendimiento, conectividad y fiabilidad. * Experiencia sólida en la operación de Kubernetes en entornos productivos. * Experiencia en el soporte de infraestructuras productivas a gran escala y sistemas distribuidos. * Experiencia demostrada liderando investigaciones técnicas y gestionando incidentes complejos. * Experiencia realizando análisis de causa raíz e impulsando mejoras operativas a largo plazo. * Conocimientos sólidos sobre observabilidad, supervisión y prácticas de fiabilidad de servicios. * Excelentes habilidades analíticas y de resolución de problemas en múltiples dominios de infraestructura. * Excelentes habilidades de comunicación, colaboración y gestión de partes interesadas. **Es muy deseable contar con experiencia en uno o varios de los siguientes ámbitos:** * Infraestructura de GPU NVIDIA y plataformas de computación acelerada. * Redes InfiniBand y NVIDIA UFM. * Entornos de infraestructura de IA. * Entornos de computación de alto rendimiento (HPC). * Ingeniería de plataformas o ingeniería de fiabilidad de sitios (SRE). * Operaciones de Kubernetes a gran escala. * Tecnologías de automatización de infraestructura y prácticas de Infraestructura como Código (IaC). * Plataformas de observabilidad como Grafana, Prometheus, ELK u OpenTelemetry. * Análisis y optimización del rendimiento de plataformas de infraestructura distribuida. * Liderazgo técnico, mentoría o responsabilidades como líder de equipo. **Información adicional** **Ofrecemos:** * Operar algunos de los entornos de infraestructura de IA más avanzados en producción actualmente. * Trabajar con las últimas tecnologías de GPU NVIDIA, plataformas Kubernetes y entornos de red de alto rendimiento. * Contribuir a la definición de estándares operativos y prácticas de fiabilidad para servicios de infraestructura de IA de próxima generación. * Influenciar la adopción de capacidades operativas impulsadas por IA mediante k0rdent AI. * Trabajar junto a ingenieros altamente cualificados que resuelven desafíos complejos de infraestructura y plataforma a escala. * Unirse a una organización en crecimiento que invierte fuertemente en infraestructura de IA, servicios de plataforma e innovación operativa. \#Remoto ¡Somos Líder en Gestión de Contenedores según G2 (n.º 2 tras AWS)!

Fuentea: indeed
Parte del contenido se ha traducido automáticamente

Publicado por

David Muñoz

Indeed · HR

Ubicación

David Muñoz

Indeed · HR

Empleos similares

Ingeniero Senior de Infraestructura de IA y Operaciones de Plataforma (trabajo remoto en la UE) de Indeed en 2026 | ok.com