Ingeniero/a de Orquestación de Cargas de Trabajo

Compañía
Descripción
Resumen: Como Ingeniero/a de Orquestación de Cargas de Trabajo, supervisará y avanzará la pila tecnológica de orquestación de cargas de trabajo en las plataformas HPC y AI Factory. Aspectos destacados: 1. Avanzar la pila tecnológica de orquestación de cargas de trabajo en plataformas HPC e IA 2. Implementar, configurar y ajustar finamente las plataformas de orquestación 3. Garantizar la ejecución sin interrupciones de grandes proyectos de IA y ciencia computacional En Roche puedes ser plenamente tú mismo/a y tus cualidades únicas serán valoradas. Nuestra cultura fomenta la expresión personal, el diálogo abierto y conexiones auténticas. Aquí serás valorado/a, aceptado/a y respetado/a por lo que eres. Esto crea un entorno en el que puedes crecer tanto personal como profesionalmente. Juntos queremos prevenir, detener y curar enfermedades, y garantizar que todas las personas tengan acceso a la atención sanitaria, hoy y en el futuro. Únete a Roche, donde cada voz cuenta. El puesto Descripción del puesto Como Ingeniero/a de Orquestación de Cargas de Trabajo dentro del equipo de Ingeniería de Computación Acelerada (ACE), serás responsable de supervisar y avanzar nuestra pila tecnológica de orquestación de cargas de trabajo tanto en nuestras plataformas de Computación de Alto Rendimiento (HPC) como en nuestras plataformas líderes del sector de Fábrica de IA. Con la rápida expansión de nuestra infraestructura informática, programar, gestionar y maximizar eficientemente la utilización de nuestros entornos de CPU y GPU es fundamental. Serás responsable de implementar, configurar y ajustar finamente las plataformas de orquestación que programan cargas de trabajo computacionales masivas y paralelas. Al aplicar políticas sólidas de programación para flujos de trabajo científicos tradicionales y cargas de trabajo modernas de IA contenerizadas, cerrarás la brecha entre una elevada capacidad computacional y su ejecución eficiente. Tu trabajo garantizará directamente que los investigadores, científicos de datos e ingenieros de Roche puedan ejecutar sin interrupciones grandes entrenamientos de modelos de IA y simulaciones de ciencia computacional a escala. Descripción del área Hosting e Infraestructura (HI) proporciona infraestructura crítica local, servicios de alojamiento en la nube, conectividad y productos tecnológicos que permiten a todas las funciones en cada sede de Roche desarrollar, innovar, conectar y ofrecer productos digitales conformes en toda la empresa Roche. Las Cadenas de Valor — Equipo de Ingeniería de Computación Acelerada (ACE) — se centran en impulsar tanto el éxito del cliente como el del producto mediante su función como centro de excelencia y entrega para la infraestructura de Computación de Alto Rendimiento y de IA que respalda casos de uso de IA y HPC en Roche. Este equipo facilita una incorporación y adopción sin interrupciones para los clientes verticales empresariales que necesitan computación acelerada, ayudando a esos usuarios de infraestructura cuyas necesidades están optimizadas para alta disponibilidad, transferencia de datos sin interrupciones, flexibilidad, velocidad y las necesidades cambiantes de la IA, logrando así un tiempo rápido hasta el valor. Responsabilidades del puesto Implementación y gobernanza de la pila de orquestación * Diseñar, implementar y mantener el ecosistema del Gestor de Cargas de Trabajo SLURM en nuestras arquitecturas de clúster HPC, garantizando alta disponibilidad y distribución óptima de recursos. * Implementar y gestionar Run:ai como capa central de orquestación y virtualización para la Fábrica de IA, permitiendo la asignación fraccionada de GPU y la asignación dinámica de recursos. * Evaluar, diseñar e implementar integraciones SLURM Slinky cuando sea necesario para vincular sin interrupciones la orquestación de IA basada en Kubernetes con los recursos tradicionales de clúster HPC. Contenerización y optimización de cargas de trabajo * Definir buenas prácticas y marcos para la ejecución científica contenerizada, utilizando Singularity/Apptainer y/o Enroot para proporcionar entornos seguros y reproducibles de alto rendimiento para HPC. * Traducir los requisitos de los usuarios y de las cargas de trabajo en parámetros de programación optimizados (por ejemplo, programación consciente de la topología, escalado multi-nodo). * Perfilado y ajuste activo de colas de programación, parámetros de calidad de servicio (QoS) y políticas de reparto equitativo para maximizar la eficiencia en entornos multiusuario. Fiabilidad y telemetría de la plataforma * Colaborar con los ingenieros de Observabilidad para implementar monitoreo continuo, telemetría y paneles de informes que rastreen la eficiencia del programador, los tiempos de espera en cola y las tasas de utilización del hardware. * Diagnosticar fallos complejos en cargas de trabajo, incluidos problemas de sincronización en entrenamientos distribuidos, cuellos de botella en comunicaciones MPI e incompatibilidades de controladores. * Mantener modelos de configuración-como-código para la capa de programación, aprovechando la automatización para desplegar uniformemente las políticas del clúster. Requisitos Formación / Experiencia * Licenciatura o título superior en Ciencias de la Computación, Matemáticas Aplicadas, Ingeniería Computacional o disciplina técnica similar. * Más de 5 años de experiencia en ingeniería de sistemas, con especial énfasis en programación de cargas de trabajo, gestión de recursos y optimización de clústeres en entornos multiusuario. * Conocimientos técnicos profundos sobre sistemas operativos Linux empresarial y arquitecturas de sistemas distribuidos. * Programación HPC y herramientas: Competencia experta en la administración de SLURM, incluidos diseños complejos de particiones, contabilidad y gestión de complementos. Alta competencia en Singularity para la ejecución de entornos contenerizados. * Orquestación de IA: Experiencia práctica o comprensión arquitectónica profunda de Run:ai, Kubernetes y paradigmas de programación de GPU contenerizados. * Conocimientos de infraestructura: Comprensión sólida de interconexiones de alta velocidad (InfiniBand, RoCE) y arquitecturas de comunicación multi-nodo (MPI, NCCL) en relación con la ubicación de trabajos. * Automatización: Competencia en la automatización de configuraciones del programador y la recopilación de telemetría, o en herramientas de automatización de infraestructura. **Liderazgo y mentalidad:** * Mentalidad Lean y Ágil: Enfoque muy marcado en impulsar la eficiencia, reducir el tiempo de inactividad computacional y crear vías sin fricciones para la presentación de cargas de trabajo por parte de los usuarios. * Colaboración y defensa: Capacidad sobresaliente para traducir los retos de los flujos de trabajo científicos y de modelos de IA en configuraciones escalables del programador. * Curiosidad intelectual: Una fuerte pasión por mantenerse a la vanguardia de las tendencias del sector respecto al fraccionamiento y la partición de GPU, y a la convergencia de cargas de trabajo de IA con programadores HPC tradicionales. Quiénes somos Un futuro más saludable nos impulsa a innovar. Más de 100.000 empleados en todo el mundo trabajan juntos para lograr avances científicos y garantizar que todas las personas tengan acceso a la atención sanitaria, hoy y para las generaciones futuras. Gracias a nuestro compromiso, más de 26 millones de personas reciben tratamiento con nuestros medicamentos y se realizan más de 30.000 millones de pruebas con nuestros productos diagnósticos. Nos animamos mutuamente a explorar nuevas posibilidades, fomentar la creatividad y fijarnos objetivos ambiciosos para ofrecer soluciones sanitarias transformadoras. Juntos podemos forjar un futuro más saludable. Roche es un empleador que promueve la igualdad de oportunidades.
Publicado por

David Muñoz
Indeed · HR





