Ingeniero Senior de Confiabilidad del Sitio - SRE

Indeed

Compañía

Tipo de empleoTiempo completo
Modalidad de trabajoPresencial
Nivel de experienciaSin requisito de experiencia
Nivel educativoSin requisito de título

Descripción

Resumen: Buscamos un Ingeniero Senior de Confiabilidad del Sitio (SRE) apasionado para garantizar la confiabilidad, escalabilidad y rendimiento de los servicios críticos para la misión, impulsando la automatización y la excelencia operativa. Aspectos destacados: 1. Dar forma a las prácticas de SRE y afectar significativamente la excelencia operativa del producto. 2. Ser un experto en Datadog para supervisión, alertas, registro de eventos (logging) y seguimiento (tracing). 3. Impulsar la excelencia operativa y reducir la carga operativa repetitiva (toil) mediante la automatización. **Descripción de la empresa** **Redzone es la solución #1 para la fuerza laboral conectada**, tanto para fabricantes grandes como pequeños. Trabajamos para mejorar la eficiencia en las plantas, brindar capacitación sobre las mejores prácticas y capacitar al personal de primera línea para que mejore la calidad de su trabajo y de su vida laboral, proporcionándoles herramientas, procesos y herramientas de colaboración que mantengan sus líneas de fabricación funcionando sin interrupciones y con eficiencia. En Redzone nos centramos en la experiencia del cliente, escuchamos al cliente y ofrecemos soluciones que generan excelentes resultados. Somos una combinación de una excelente dirección, años de experiencia en manufactura y un equipo tecnológico extraordinario que trabajan juntos para crear productos excepcionales. Este puesto es completamente remoto. **Descripción del puesto** Estamos ampliando nuestro equipo de **Ingeniería de Confiabilidad del Sitio (SRE)** y buscamos un Ingeniero Senior de SRE altamente calificado y apasionado para unirse a nosotros. Como miembro de nuestra creciente función de SRE, desempeñará un papel fundamental para garantizar la confiabilidad, escalabilidad y rendimiento de nuestros servicios críticos para la misión, que sustentan la experiencia de nuestros clientes. Esta es una oportunidad emocionante para dar forma a nuestras prácticas de SRE, impulsar la automatización y afectar significativamente la excelencia operativa de nuestro producto. **Qué hará:** * Impulsar la excelencia operativa: Diseñar, implementar y mantener sistemas altamente disponibles, escalables y resilientes que ofrezcan una experiencia excepcional al cliente. * Experto en Datadog: Ser uno de los expertos de referencia en Datadog. Será responsable de definir, implementar y hacer cumplir las mejores prácticas para la supervisión, las alertas, el registro de eventos (logging), el seguimiento (tracing) y las pruebas sintéticas en todo nuestro entorno de AWS. Esto incluye una configuración práctica profunda, la creación de paneles de control (dashboards), la resolución de problemas y la optimización dentro de Datadog. * https://www.smartrecruiters.com/app/jobs/details/1a099a5c\-2719\-44ea\-b9fb\-43833ab4f60f/jobad/726f1bba\-3ffb\-4544\-a5ec\-d689eea24fc0 1/4 * 29/5/26, 10:48 AM Puesto • SmartRecruiters * Desarrollo de software para la confiabilidad: Desarrollar software y herramientas robustas, bien probadas y mantenibles para automatizar tareas operativas, crear capacidades de auto-servicio para los equipos de ingeniería y mejorar la confiabilidad del sistema. Esto implicará construir aplicaciones, no solo scripts. Campeón de la reducción de la carga operativa repetitiva (toil): Identificar y eliminar la carga operativa repetitiva mediante la automatización, mejoras de procesos y resolución sistemática de problemas. Actuar de forma proactiva para cambiar nuestro enfoque operativo desde la respuesta reactiva a incidentes hacia la ingeniería proactiva. * Gestión de incidentes y análisis posterior (post-mortems): Contribuir y evolucionar nuestro marco de respuesta a incidentes, participando en turnos de guardia (usando OpsGenie). Liderar análisis posteriores (post-mortems) sin asignación de culpas, extrayendo conclusiones accionables e impulsando mejoras sistémicas para prevenir recurrencias. Métricas y objetivos de confiabilidad: Colaborar con los equipos de ingeniería para definir, implementar y supervisar Indicadores de Nivel de Servicio (SLI), Objetivos de Nivel de Servicio (SLO) y Presupuestos de errores. Utilizar estas métricas para impulsar la mejora continua y tomar decisiones basadas en datos acerca de las inversiones en confiabilidad. Infraestructura como código (IaC): Aprovechar y contribuir a nuestros esfuerzos de infraestructura como código (IaC), avanzando hacia un entorno totalmente automatizado mediante Terraform y GitHub Actions. * Diseño y arquitectura de sistemas: Brindar experiencia de SRE en revisiones de diseño de sistemas, influyendo en las decisiones arquitectónicas para integrar confiabilidad, observabilidad y escalabilidad en nuestros servicios desde sus fundamentos. * Compartir conocimientos y tutoría: Documentar procesos, elaborar manuales operativos (runbooks) y compartir su experiencia tanto con el equipo de SRE como con toda la organización de ingeniería. Ayudar a fomentar una cultura de SRE basada en la propiedad compartida y el aprendizaje continuo. **Requisitos** **Qué aportará** **Capacidades fundamentales de SRE** * Experiencia demostrada gestionando y mejorando sistemas de producción a gran escala en un rol de SRE, Ingeniería de Producción o Ingeniería de Plataforma. * Capacidad comprobada para construir rápidamente modelos mentales precisos de sistemas distribuidos complejos en los ámbitos de infraestructura, aplicaciones, redes, identidad y observabilidad. * Excelentes habilidades de resolución de problemas, con un enfoque metódico y basado en evidencias para la respuesta a incidentes y el análisis de causas raíz. * Experiencia definiendo, implementando y utilizando Indicadores de Nivel de Servicio (SLI), Objetivos de Nivel de Servicio (SLO) y presupuestos de errores para orientar las decisiones sobre confiabilidad. * Excelentes habilidades comunicativas escritas y orales, con capacidad para explicar claramente cuestiones técnicas complejas tanto a audiencias técnicas como no técnicas. **Ámbitos técnicos** **Experiencia en varios de los siguientes campos:** * Plataformas Kubernetes, incluido Amazon EKS, y tecnologías de malla de servicios como Istio. * Infraestructura y servicios en la nube dentro de AWS. * Sistemas de gestión de identidad y acceso, incluidos Auth0 y AWS IAM.\\ * Fundamentos de redes, incluidos DNS, equilibrio de carga, enrutamiento, TLS y resolución de problemas de conectividad. * Flujos de trabajo GitOps y automatización de infraestructura mediante herramientas como Flux y Terraform. * Plataformas y prácticas de observabilidad, incluidas métricas, registros (logs), trazas (traces), alertas, paneles de control (dashboards) y monitoreo sintético. * Sistemas CI/CD y flujos de trabajo de ingeniería. * Registro de aplicaciones y depuración de sistemas distribuidos. * Mentalidad de ingeniería **Un sólido ingeniero SRE:** * Prioriza la estabilidad del servicio y el impacto en el cliente durante los incidentes. * Se toma su tiempo bajo presión, recopila hechos y comunica con claridad. * Reduce la complejidad operativa mediante la automatización y la simplificación. * Identifica y elimina la carga operativa repetitiva (toil) mediante herramientas de auto-servicio y mejoras de procesos. * Demuestra fuertes instintos de scripting y automatización. * Aplica un enfoque de pensamiento sistémico a la resolución de problemas. * Equilibra la corrección a corto plazo con mejoras a largo plazo en la confiabilidad. **Ingeniería de software para la confiabilidad** * Capacidad demostrada para construir y mantener automatizaciones, herramientas y capacidades de auto-servicio utilizando uno o más lenguajes de programación o scripting, como Python, Go o Bash. * Se enfoca en aplicar prácticas de ingeniería de software para mejorar la confiabilidad, reducir la carga operativa repetitiva (toil) y potenciar la productividad de los desarrolladores. Expectativas conductuales * Mantener la calma y ser eficaz durante incidentes de alta gravedad. * Capacidad para gestionar situaciones complejas que involucren múltiples equipos y prioridades en conflicto. * Capacidad para liderar análisis posteriores (post-mortems) sin asignación de culpas y conducir acciones de seguimiento significativas. * Pasión por la mejora continua y por fomentar una cultura de propiedad compartida. **Puntos adicionales (deseables):** * Experiencia definiendo y trabajando con SLO, SLI y presupuestos de errores. * Familiaridad con otras herramientas o conceptos de observabilidad además de Datadog. * Experiencia con plataformas de banderas de características (feature flagging) como LaunchDarkly. **Información adicional** QAD Inc. es un proveedor líder de software empresarial adaptativo basado en la nube y servicios para empresas manufactureras globales. Las empresas manufactureras globales enfrentan una interrupción cada vez mayor provocada por la innovación impulsada por la tecnología y los cambios en las preferencias de los consumidores. Para sobrevivir y prosperar, los fabricantes deben poder innovar y cambiar sus modelos de negocio a velocidades sin precedentes. QAD denomina a estas empresas «Empresas Manufactureras Adaptativas». Las soluciones de QAD ayudan a los clientes de los sectores automotriz, ciencias de la vida, embalaje, productos de consumo, alimentos y bebidas, alta tecnología y fabricación industrial a adaptarse rápidamente al cambio e innovar para obtener ventaja competitiva. QAD se compromete a garantizar que cada empleado sienta que trabaja en un entorno que valora sus contribuciones, respeta sus perspectivas únicas y ofrece oportunidades de crecimiento independientemente de su trasfondo. El programa de Diversidad, Equidad e Inclusión (DEI) de QAD está impulsando niveles más altos de diversidad, equidad e inclusión para que los empleados puedan ser auténticos en su lugar de trabajo. Somos un empleador que ofrece igualdad de oportunidades y no discriminamos a ningún empleado ni candidato por motivos de raza, color, sexo, edad, origen nacional, religión, orientación sexual, identidad de género, condición de veterano o discapacidad, ni por ninguna otra categoría protegida federal, estatal o local. **Acerca de QAD y QAD Redzone:** QAD Inc. es un proveedor líder de software empresarial adaptativo basado en la nube y servicios para empresas manufactureras globales. Las empresas manufactureras globales enfrentan una interrupción cada vez mayor provocada por la innovación impulsada por la tecnología y los cambios en las preferencias de los consumidores. Para sobrevivir y prosperar, los fabricantes deben poder innovar y cambiar sus modelos de negocio a velocidades sin precedentes. QAD denomina a estas empresas «Empresas Manufactureras Adaptativas». QAD Redzone ayuda a materializar la visión de QAD para la Empresa Adaptativa. Las mejoras en la productividad laboral impactan directamente la eficiencia. Los empleados productivos y empoderados incrementan la capacidad efectiva de su planta y aceleran el tiempo necesario para que los nuevos empleados alcancen su plena productividad, otorgando a los fabricantes la agilidad necesaria para aumentar la producción más allá de lo previamente posible sin tener que invertir en equipos de producción o nuevas plantas, y reduciendo la cantidad y el impacto de la rotación de empleados. Los empleados empoderados con mentalidad de crecimiento asumen una responsabilidad absoluta ante los desafíos que afectan sus objetivos de producción, creando resiliencia frente a las interrupciones. Somos un empleador que ofrece igualdad de oportunidades y no discriminamos a ningún empleado ni candidato por motivos de raza, color, sexo, edad, origen nacional, religión, orientación sexual, identidad de género, condición de veterano o discapacidad, ni por ninguna otra categoría protegida federal, estatal o local. \#LI\-Remote

Fuentea: indeed
Parte del contenido se ha traducido automáticamente

Publicado por

David Muñoz

Indeed · HR

Ubicación

Empleos similares

David Muñoz

Indeed · HR

Empleos similares

Ingeniero Senior de Confiabilidad del Sitio - SRE de Indeed en 2026 | ok.com