Descripción
**El conjunto de seguridad Imunify360** es un producto de CloudLinux Inc., creador del sistema operativo n.º 1 en seguridad y estabilidad para proveedores de servicios de alojamiento. Imunify es una solución innovadora de seguridad diseñada específicamente para servidores compartidos y VPS/dedicados. Esta solución automatizada y fácil de usar, basada en un enfoque de seis capas de seguridad, ofrece una prevención integral y completa contra ataques. Consulte nuestro sitio web para obtener más información: imunify360\.com
**Estamos buscando un ingeniero experimentado de canalizaciones de IA para que se haga cargo de las canalizaciones automatizadas que convierten la inteligencia sobre amenazas en protección implementada para decenas de millones de sitios web.**
Cuando aparece una nueva vulnerabilidad, una cadena de sistemas automatizados debe detectarla, obtener el código fuente vulnerable, generar reglas para el firewall de aplicaciones web (WAF), crear pruebas, comprobar que dichas reglas funcionan correctamente y no interrumpen el tráfico legítimo, y desplegarlas en decenas de millones de sitios web; además, debe supervisar la producción con suficiente rigor para retirarlas automáticamente si presentan un comportamiento anómalo. Actualmente, dicha cadena ya existe y opera las 24 horas del día, los 7 días de la semana, y un solo eslabón poco fiable podría privar a los clientes de su protección. Buscamos un ingeniero sólido que amplíe rápidamente este sistema manteniéndolo fiable y transparente. Esto implica resolver problemas complejos de ingeniería, trabajar con datos a gran escala y adaptarse a un entorno lleno de sorpresas.
Este no es un puesto de analista ni de investigación, aunque sí se valora positivamente experiencia adicional en este ámbito. Lo que necesitamos es alguien capaz de construir sistemas que sigan funcionando: **lógica compleja en el interior, aburridos y fiables en el exterior.** El puesto es totalmente remoto con horarios flexibles, lo que le permite planificar su jornada laboral y trabajar desde cualquier lugar del mundo.
**Qué asumiría como responsabilidad**
**Sistemas actualmente en producción y que deben crecer considerablemente:**
* **La canalización automatizada de protección** — la cadena que va desde la inteligencia sobre amenazas hasta una regla validada e implementada. De múltiples etapas, mayormente autónoma y obligada a completarse dentro de una ventana de tiempo fija cada día.
* **Automatización de lanzamientos progresivos** — despliegue controlado de la protección en etapas sucesivas sobre toda la infraestructura, con salvaguardias automáticas que detienen o revierten una etapa sin intervención humana.
* **Puntos de control de calidad** — decisión, basada en señales reales de producción, sobre si algo que hemos desplegado está causando daño, y actuación inmediata antes de que pase a la siguiente etapa. Los errores son costosos en ambas direcciones: pasar por alto un problema puede hacer que fallen los sitios de los clientes; corregir en exceso puede eliminar silenciosamente la protección.
* **Integración continua a gran escala** — validación que levanta entornos reales y descartables en una matriz amplia de versiones y configuraciones de software, y devuelve un veredicto fiable con suficiente rapidez para cumplir la ventana de lanzamiento.
* **Orquestación de modelos de lenguaje de gran tamaño (LLM) y control de costes** — varios subsistemas son gestionados por agentes de IA dentro de entornos específicos, con componentes fundamentales de evaluación, presupuestos y contabilidad de gastos.
* **Observabilidad y alertas en todos los sistemas mencionados** — se espera que las canalizaciones informen sobre su propio estado, demuestren su buen funcionamiento y escalen automáticamente ante anomalías.
Esto se ejecuta sobre una **base de datos de inteligencia sobre amenazas a escala de petabytes y telemetría en vivo procedente de más de 60 millones de sitios web**, bajo **estrictos presupuestos de latencia de extremo a extremo medidos en horas**. El modo de fallo que más nos preocupa eliminar es el incumplimiento silencioso de dichos presupuestos.
Entraremos en los detalles específicos durante el proceso de entrevista.
**Responsabilidades clave**
* Diseñar, construir y operar las canalizaciones automatizadas descritas anteriormente, de extremo a extremo;
* Transformar trabajos por lotes frágiles de varias etapas en sistemas reanudables, idempotentes y observables, con máquinas de estado explícitas y rutas de recuperación;
* Definir y hacer cumplir presupuestos de latencia y objetivos de nivel de servicio (SLO) por etapa, y hacer visibles y accionables las violaciones, en lugar de dejarlas pasar en silencio;
* Construir la capa de observabilidad — métricas, paneles de control, alertas y puertas de salud — para que la canalización informe sobre su propio estado sin necesidad de que alguien vaya a comprobarlo manualmente;
* Diseñar e implementar salvaguardias: pausa y reversión automáticas, límites del radio de impacto, interruptores de apagado de emergencia y comportamiento seguro por defecto cuando una dependencia externa no está disponible;
* Hacer que los sistemas requieran mínima intervención: eliminar pasos manuales, suprimir la supervisión humana constante y reducir la superficie operativa en lugar de ampliarla;
* Escribir y mantener pruebas unitarias e integradas para lógica difícil de probar realmente — concurrencia, fallos parciales, inestabilidad de API externas, estado de múltiples etapas;
* Investigar y resolver problemas complejos en ClickHouse, GitLab CI, S3/almacenamiento de objetos, Prometheus/Grafana y APIs de terceros;
* Colaborar con los analistas de seguridad y el equipo de servidores en la arquitectura, y objetar diseños propuestos que no resistan el contacto con la producción.
**Requisitos** **Para sobresalir en este puesto, debe tener:**
* **Más de 5 años de experiencia profesional en ingeniería backend/plataforma/infraestructura;**
* **Experiencia demostrable en la construcción y operación de canalizaciones de datos o automatización de varias etapas** — sistemas CI/CD, ETL/ELT, automatización de compilación y lanzamiento, orquestación de trabajos, plataformas de ML/datos o similares. Este es el requisito más importante. Le pediremos que nos explique detalladamente uno de ellos;
* **Conocimientos profundos en al menos uno de los siguientes lenguajes: Python, Go o Rust.** Usamos los tres, y no buscamos especialistas en ningún lenguaje específico — cuál traiga realmente no importa. La profundidad simplemente sirve para verificar que su experiencia es real, así que espere preguntas específicas sobre sistemas que haya diseñado y desplegado: por qué tienen esa estructura, cómo se comportan ante fallos y qué construiría de forma distinta hoy;
* **Capacidad de juicio en diseño de sistemas, más que velocidad bruta de programación.** Lo difícil en este puesto es decidir qué construir, anticipar dónde fallará y hacer que el sistema demuestre su propia corrección — no la cantidad de código producido;
* Experiencia práctica en **orquestación de flujos de trabajo y programación de tareas** (Airflow, Temporal, Prefect, Dagster, Argo, programadores personalizados u otros que haya ejecutado realmente en producción);
* Una intuición práctica de **ingeniería de fiabilidad**: idempotencia, reintento con retroceso, exactamente una vez frente a al menos una vez, puntos de control y capacidad de reanudación, degradación elegante, contrapresión y manejo seguro de fallos parciales;
* Experiencia práctica en **observabilidad** — Prometheus/Grafana, pila LGTM u otra equivalente — incluida la definición de métricas, no solo el consumo de paneles creados por otros;
* Experiencia sólida en **CI/CD**, idealmente **GitLab CI**, incluidas canalizaciones dinámicas/hijas y ejecutores autoalojados; comodidad con Docker y entornos de prueba basados en contenedores;
* Experiencia con **almacenamiento de objetos** (S3/Ceph o equivalente) y con almacenes analíticos a gran escala — **ClickHouse** u otra base de datos columnar;
* Capacidad para diseñar **máquinas de estado y procesos de larga duración** que sobrevivan a reinicios, y razonar sobre la concurrencia entre múltiples despliegues simultáneos;
* Excelentes habilidades de depuración en las capas de sistema, red y datos;
* Buenas habilidades comunicativas y comodidad para trabajar en equipos distribuidos;
* Al menos un nivel intermedio-alto de competencia oral y escrita en inglés.
**Valorable:**
* Experiencia con **entrega progresiva** — despliegues canario y basados en porcentajes, banderas de funciones, reversión automática y control del radio de impacto;
* Experiencia en ejecución de **sistemas de IA/modelos de lenguaje de gran tamaño (LLM) en producción**, especialmente en control de costes, contabilidad de tokens, entornos de evaluación y manejo de componentes no deterministas dentro de una canalización determinista;
* Experiencia con **telemetría a escala de infraestructura** y con la construcción de puertas de calidad sobre señales ruidosas de producción;
* Conocimientos básicos de WordPress, PHP o conceptos de WAF/ModSecurity;
* Experiencia con gestión de configuración (Ansible, Puppet, Salt) y operaciones de servicios Linux.
**No necesita antecedentes en ciberseguridad.** La mayoría de los problemas difíciles aquí están relacionados con la orquestación, la fiabilidad, la corrección bajo concurrencia y la observabilidad. El conocimiento del dominio es adquirible y contamos con especialistas de los que aprenderlo — el juicio en ingeniería de canalizaciones es lo que no podemos sustituir.
**Valoramos a los ingenieros que son:**
* **Solucionadores de problemas curiosos y sin miedo** — dispuestos a profundizar en sistemas existentes, investigar causas fundamentales y proponer mejoras;
* **Escépticos por defecto** — que se pregunten qué invalidaría una conclusión antes de actuar sobre ella, y que confíen más en las mediciones que en el razonamiento plausible;
* **Pragmáticos y orientados al detalle** — centrados en construir sistemas fiables y mantenibles, y alérgicos a soluciones que requieran que un ser humano recuerde algo;
* **Responsables** — cómodos asumiendo la responsabilidad de si una canalización se ejecutó correctamente la noche anterior;
* **Comunicadores eficaces** — capaces de articular ideas con claridad, intercambiar retroalimentación de forma constructiva y fomentar la colaboración entre equipos;
* **Participativos y proactivos** — aportando energía, iniciativa y una presencia positiva que fortalezca la cultura del equipo.
**Beneficios** **¿Qué obtiene usted?**
* Fuerte énfasis en el desarrollo profesional, con oportunidades de aprendizaje y crecimiento: proyectos interesantes y desafiantes, programas de tutoría y otros intercambios de conocimiento;
* Trabajo completamente remoto con horarios flexibles, que le permite organizar su jornada y trabajar desde cualquier ubicación del mundo;
* 24 días pagados de vacaciones al año, 10 días festivos nacionales y licencias médicas ilimitadas para garantizar un equilibrio saludable entre vida laboral y personal;
* Compensación para un seguro médico privado;
* Reembolso para espacios de coworking y gimnasio/deporte;
* Oportunidad de recibir una recompensa por la idea más innovadora que la empresa pueda patentar, fomentando una cultura de creatividad e innovación.
Al solicitar este puesto, usted acepta el tratamiento de sus datos personales tal como se describe en nuestra Política de Privacidad, que contiene información detallada sobre cómo mantenemos y gestionamos sus datos.