Ingeniero Senior de Observabilidad y Telemetría - Radian Arc

Compañía
Descripción
Resumen: Diseñar y construir una plataforma de observabilidad para infraestructura en la nube de GPU a gran escala, permitiendo información en tiempo real sobre cargas de trabajo distribuidas de inteligencia artificial e implementaciones perimetrales. Aspectos destacados: 1. Liderar importantes iniciativas de observabilidad y evolucionar los estándares de telemetría. 2. Colaborar con los equipos de infraestructura, redes y almacenamiento. 3. Mejorar la confiabilidad de la plataforma mediante el análisis de la telemetría en producción. **Ubicación y modalidad de trabajo:** EMEA (teletrabajo) **Inicio:** Lo antes posible **Tipo de contrato:** Indefinido, jornada completa **Acerca de Radian Arc** Radian Arc, ahora parte de InferX, la plataforma de nube de IA y GPU de Submer, ofrece una plataforma de infraestructura como servicio (IaaS) para ejecutar aplicaciones de juegos en la nube, inteligencia artificial y aprendizaje automático dentro de las redes de operadores de telecomunicaciones. Nuestros equipos en Estados Unidos, Australia, Europa Central, Malasia, Singapur y Japón ofrecen a los operadores de telecomunicaciones una plataforma de computación perimetral basada en GPU sin necesidad de inversión de capital, facilitando baja latencia y mejores economías para servicios de valor añadido y la monetización de las inversiones en 5G. **Impacto que tendrás** Misión: Diseñar y construir la plataforma de observabilidad que impulse la visibilidad, la confiabilidad y las percepciones de rendimiento para infraestructuras en la nube de GPU a gran escala, así como para implementaciones perimetrales más pequeñas. Este puesto es responsable del diseño e implementación de partes clave de la arquitectura de observabilidad en toda la plataforma, permitiendo que los equipos de ingeniería, operaciones y clientes comprendan el comportamiento del sistema en tiempo real en cargas de trabajo distribuidas de IA, clústeres de GPU, redes de interconexión, sistemas de almacenamiento y entornos de inferencia perimetral. Diseñarás y operarás tuberías de telemetría de baja latencia y alta escala que recojan, procesen y analicen métricas, registros y rastreos procedentes de infraestructuras que se ejecutan en clústeres centrales de centros de datos y en implementaciones perimetrales más pequeñas. La plataforma que construyas apoyará las operaciones internas, mecanismos automatizados de confiabilidad y experiencias de observabilidad orientadas al cliente. Como ingeniero senior, liderarás la entrega de importantes iniciativas de observabilidad, contribuirás a la evolución de los estándares de telemetría y la implementación de SLO, y colaborarás con otros equipos para garantizar que la observabilidad se integre eficazmente en la arquitectura de la plataforma, desde las capas de infraestructura hasta las de aplicación. Colaborarás estrechamente con los equipos de infraestructura, redes, almacenamiento e ingeniería de plataformas para ofrecer una visibilidad clara de los cuellos de botella de rendimiento, la degradación de la infraestructura y el comportamiento de las cargas de trabajo distribuidas, tanto en entornos de GPU a escala hiperveloz como en instalaciones perimetrales más pequeñas. Este puesto contribuye directamente a mejorar la confiabilidad de la plataforma mediante el análisis de la telemetría en producción, la identificación de problemas sistémicos y la promoción de mejoras en rendimiento, eficiencia y estabilidad operativa en toda la pila. **Qué harás** **Arquitectura de la plataforma de observabilidad** * Diseñar e implementar tuberías escalables de telemetría para métricas, registros y rastreos en infraestructura distribuida de GPU. * Diseñar sistemas de observabilidad capaces de ingerir telemetría de alta cardinalidad procedente de miles de nodos y servicios. * Construir y operar sistemas de almacenamiento de telemetría optimizados para grandes volúmenes de datos temporales y por eventos. * Contribuir a los estándares de observabilidad entre servicios, incluyendo métricas, instrumentación de rastreo, registro y la implementación de SLO. **Observabilidad de infraestructura y plataforma** * Generar visibilidad en las capas de cómputo, almacenamiento y redes de la plataforma. * Instrumentar clústeres de GPU, cargas de trabajo de inferencia y entornos de entrenamiento distribuido. * Detectar degradación de la infraestructura, como: * Reducción de frecuencia de GPU, * Congestión de red, * Latencia de almacenamiento, * Degradación de hardware. * Implementar tuberías de telemetría para métricas de rendimiento de GPU, CPU, red y almacenamiento. **Observabilidad orientada al cliente** * Construir paneles de control y herramientas de monitorización que expongan la salud y el rendimiento del sistema tanto a equipos internos como a clientes. * Proporcionar percepciones sobre el rendimiento de las cargas de trabajo, incluyendo: * Uso de GPU, * Rendimiento de almacenamiento, * Latencia de red, * Rendimiento de inferencia distribuida. * Desarrollar herramientas de análisis de rendimiento que ayuden a los clientes a comprender los cuellos de botella del sistema. **Telemetría de redes e infraestructura** * Desarrollar y mantener plataformas de observabilidad de redes. * Construir colectores y exportadores de telemetría utilizando Python o Go. * Ingerir telemetría procedente de componentes de infraestructura, incluyendo: * NVIDIA Cumulus Linux, * Routers VyOS, * Citrix NetScaler / WAF. * Diseñar tuberías de ingesta de telemetría utilizando protocolos tales como: * gNMI, * SNMP, * Telemetría en streaming. **Ingeniería de confiabilidad** * Diseñar sistemas avanzados de alertas y detección de anomalías. * Contribuir a los SLO, SLI y métricas de confiabilidad de la plataforma. * Construir detección automatizada de anomalías en la infraestructura. * Integrar señales de observabilidad con flujos de trabajo operativos y sistemas de gestión de incidencias. * Participar en turnos de guardia para dar soporte a la infraestructura de observabilidad y telemetría de la plataforma. **Colaboración entre equipos** * Colaborar con los equipos de plataforma, redes, almacenamiento y cómputo para instrumentar servicios. * Trabajar estrechamente con los equipos de operaciones para mejorar la monitorización y la respuesta ante incidencias. * Ofrecer orientación y tutoría a ingenieros sobre las mejores prácticas en observabilidad. * Promover buenas prácticas de observabilidad entre los equipos y ayudar a los ingenieros a adoptar patrones efectivos de instrumentación y monitorización. **Pila técnica:** Tecnologías de observabilidad y telemetría utilizadas en toda la plataforma incluyen: **Marco de observabilidad** * Prometheus. * OpenTelemetry. * Grafana. * Sistemas distribuidos de registro. * Bases de datos de telemetría a gran escala, como ClickHouse o similares. **Telemetría de hardware e infraestructura** * Telemetría Redfish / BMC. * IPMI. * Métricas del sistema Linux. * Monitorización de la salud del hardware y telemetría del ciclo de vida de los nodos. **Telemetría de GPU NVIDIA** * NVIDIA DCGM. * Exportador DCGM. * NVML. * Pila de telemetría de NVIDIA GPU Operator. * Telemetría de NVSwitch / NVLink. **Telemetría de cargas de trabajo de IA** * Telemetría de entrenamiento distribuido. * Métricas de latencia y rendimiento de inferencia. * Salud de la comunicación NCCL. * Latencia de sincronización de GPU. * Latencia de acceso a la caché KV para cargas de trabajo de inferencia. * Rendimiento de carga de conjuntos de datos y E/S de almacenamiento. **Telemetría de redes** * NVIDIA NetQ. * Telemetría en streaming gNMI. * SNMP. * Telemetría de flujos de red. * Monitorización del rendimiento RDMA / RoCE. **Qué necesitarás** **Experiencia requerida** * Experiencia demostrable en la operación de plataformas de infraestructura distribuida a gran escala. * Sólida formación en sistemas de observabilidad y tuberías de telemetría. * Experiencia en la construcción de métricas, registro, rastreo, alertas y paneles de control a escala productiva. * Fuertes habilidades de programación en Go, Python o Rust. * Experiencia con plataformas de datos temporales a gran escala. * Experiencia con plataformas en la nube de GPU a gran escala, entornos HPC o infraestructura de IA. * Experiencia en la monitorización de cargas de trabajo de IA, como clústeres de entrenamiento o inferencia. **Conocimientos de infraestructura** * Profundo conocimiento de la observabilidad de sistemas distribuidos. * Familiaridad con infraestructuras nativas en la nube, como Kubernetes, automatización y CI/CD. * Experiencia en la operación de sistemas de observabilidad para entornos de alto rendimiento o gran escala. **Telemetría de redes e infraestructura** * Experiencia en la monitorización de entornos de red complejos. * Familiaridad con protocolos de telemetría como gNMI, SNMP y telemetría en streaming. * Experiencia integrando telemetría de red y sistema en plataformas centralizadas de monitorización. **Habilidades analíticas** * Capacidad sólida de análisis de datos. * Capacidad para interpretar señales complejas de telemetría y traducirlas en percepciones accionables. * Capacidad para diagnosticar problemas de rendimiento en sistemas distribuidos. **Qué ofrecemos** * Paquete de compensación atractivo acorde con tu experiencia y competencias. * Un excelente entorno laboral caracterizado por la amabilidad, la diversidad internacional, la flexibilidad y un enfoque favorable al trabajo híbrido. * Formarás parte de una startup en rápido crecimiento con una misión de impacto positivo, ofreciendo una evolución profesional emocionante. Nuestros títulos de puesto pueden abarcar más de un nivel profesional. La remuneración base real depende de diversos factores, como habilidades transferibles, experiencia laboral, necesidades empresariales y demanda del mercado. **Nuestra responsabilidad inclusiva** Radian Arc se compromete a crear un entorno diverso e inclusivo y se enorgullece de ser una empresa que ofrece igualdad de oportunidades. Todos los candidatos calificados recibirán consideración para su contratación sin distinción de raza, color, religión, género, identidad o expresión de género, orientación sexual, origen nacional, genética, discapacidad, edad, condición de veterano u otra categoría protegida por la ley.
Publicado por

David Muñoz
Indeed · HR