Descripción
Resumen:
Axiomatic AI busca un Ingeniero Senior de Plataforma para asumir la responsabilidad de la fiabilidad, el despliegue y la excelencia operativa de su plataforma de IA, centrándose en infraestructura, CI/CD y automatización.
Aspectos destacados:
1. Liderar estrategias de despliegue y tuberías CI/CD en múltiples entornos
2. Diseñar y mantener infraestructura multi-nube y local (on-premise)
3. Desarrollar herramientas de automatización, API y scripts para mejorar la eficiencia operativa
**Sobre nosotros:**
Axiomatic AI está construyendo una nueva clase de sistemas de IA diseñados para razonar con el rigor del método científico. Al combinar el aprendizaje profundo con lógica formal y modelado basado en física, creamos sistemas de IA verificables e interpretables que colaboran con investigadores humanos y los apoyan en flujos de trabajo científicos y de ingeniería de alta relevancia.
Nuestra misión, 30×30, es lograr una mejora del 30× en la velocidad, accesibilidad y costo del desarrollo de hardware semiconductor y fotónico para 2030.
Buscamos revolucionar el diseño y la simulación de hardware en estos sectores y estamos formando un equipo de profesionales altamente motivados para llevar estas innovaciones desde la investigación hasta productos comerciales.
**Descripción del puesto**
Como Ingeniero Senior de Plataforma en Axiomatic, usted será responsable de la fiabilidad, el despliegue y la excelencia operativa de nuestra plataforma de IA. Este puesto se centra principalmente en infraestructura, CI/CD y operaciones, con responsabilidades adicionales en automatización y desarrollo de herramientas.
**Sus responsabilidades incluirán:**
* Liderar **estrategias de despliegue** y tuberías CI/CD en múltiples entornos
* Diseñar y mantener **infraestructura multi-nube** (Azure, AWS, GCP) y **despliegues locales (on-premise)**
* Gestionar **infraestructura como código** mediante Terraform para automatizar el aprovisionamiento y la configuración
* Construir sistemas integrales de **observabilidad**: monitorización, métricas, registro de eventos (logging) y alertas
* Implementar controles de **seguridad**, marcos de cumplimiento y políticas de gobernanza de datos
* Desarrollar herramientas de automatización, API y scripts (en Python) para mejorar la eficiencia operativa
* Garantizar la fiabilidad, el rendimiento y la escalabilidad del sistema
* Liderar la respuesta ante incidencias, los análisis posteriores (postmortems) y la mejora continua
* Diagnosticar y resolver problemas de infraestructura y aplicaciones en múltiples entornos.
**Su misión**
**Despliegue y CI/CD**
* Diseñar e implementar **tuberías de despliegue** para lanzamientos en múltiples entornos (desarrollo, preproducción y producción)
* Asumir el ciclo completo de despliegue: construcción, pruebas, lanzamiento y estrategias de reversión
* Implementar despliegues blue-green, versiones canarias (canary releases) y lanzamientos progresivos
* Construir herramientas y flujos de trabajo automatizados para despliegues
* Garantizar despliegues sin interrupción y capacidad de reversión
* Optimizar el rendimiento de las fases de construcción y despliegue
* Gestionar repositorios de artefactos y registros de contenedores
**Infraestructura y operaciones en la nube**
* Diseñar y operar **infraestructura multi-nube** en Azure, AWS y GCP
* Diseñar e implementar **soluciones locales (on-premise)** para clientes empresariales (basadas en Linux)
* Gestionar clústeres de Kubernetes, orquestación de contenedores y redes
* Implementar recuperación ante desastres, estrategias de copia de seguridad y continuidad del negocio
* Optimizar los costos en la nube y la utilización de recursos
* Definir y supervisar **indicadores de nivel de servicio (SLI), objetivos de nivel de servicio (SLO) y presupuestos de errores** para servicios críticos
**Infraestructura como código**
* Escribir y mantener módulos de **Terraform** para el aprovisionamiento de infraestructura
* Implementar flujos de trabajo GitOps para cambios en la infraestructura
* Automatizar el escalado, las actualizaciones y las operaciones de infraestructura
* Garantizar infraestructura reproducible y controlada por versiones
**Observabilidad y monitorización**
* Diseñar soluciones integrales de monitorización, registro de eventos (logging) y alertas (Prometheus, Grafana, Datadog o similares)
* Crear paneles de control para la salud del sistema, su rendimiento y métricas comerciales
* Implementar seguimiento distribuido (distributed tracing) para microservicios
* Realizar planificación de capacidad y análisis de rendimiento
* Impulsar mejoras de fiabilidad mediante insights basados en datos
**Seguridad y cumplimiento**
* Aplicar buenas prácticas de seguridad: gestión de identidades, gestión de secretos, políticas de red
* Trabajar hacia la obtención o mantener **certificaciones de seguridad** (SOC 2, ISO 27001 o similares)
* Realizar auditorías de seguridad y corrección de vulnerabilidades
* Implementar políticas de **gobernanza de datos** para tuberías de IA y datos de usuarios
* Garantizar el cumplimiento de regulaciones sobre privacidad de datos (GDPR, CCPA)
**Automatización y desarrollo de herramientas**
* Escribir scripts y herramientas de automatización en Python para tareas operativas
* Construir herramientas internas para despliegues, monitorización y respuesta ante incidencias
* Desarrollar manuales operativos (runbooks), automatización y sistemas auto-reparables (self-healing)
* Crear API para operaciones de infraestructura cuando sea necesario
* Mantener altos estándares de calidad de código y pruebas para las herramientas
**Fiabilidad y gestión de incidencias**
* Participar en turnos de guardia (on-call) y liderar la respuesta ante incidencias
* Realizar análisis posteriores (postmortems) sin asignación de culpas y liderar la ejecución de acciones correctivas
* Elaborar y mantener manuales operativos (playbooks) para la respuesta ante incidencias
* Mejorar la resiliencia del sistema y los modos de fallo
**Colaboración**
* Colaborar con equipos de ingeniería en estrategias de despliegue y arquitectura
* Trabajar con el equipo de seguridad en cumplimiento y gobernanza
* Mentorizar a ingenieros en mejores prácticas operativas
* Documentar sistemas, procedimientos y manuales operativos (runbooks)
**Requisitos clave**
* **Más de 7 años de experiencia** en puestos de Ingeniería de Plataforma, Ingeniería de Confiabilidad del Sitio (SRE), DevOps o Ingeniería de Infraestructura
* **Experto en despliegues**: amplia experiencia con tuberías CI/CD, estrategias de lanzamiento y despliegues en producción a gran escala
* **Experiencia multi-nube**: experiencia práctica obligatoria con **Azure y AWS** (GCP es un plus)
* **Experiencia en despliegues locales (on-premise)**: administración de sistemas Linux, aprovisionamiento en hardware físico (bare-metal), redes
* **Experto en Terraform**: amplia experiencia escribiendo y manteniendo infraestructura como código
* **Sistemas de observabilidad**: trayectoria comprobada construyendo plataformas de monitorización, alertas y métricas
* **Mentalidad de seguridad**: experiencia implementando controles y buenas prácticas de seguridad. **Se prefiere certificación en seguridad** (CISSP, CEH, especialidad en seguridad de AWS/Azure u otras similares)
* **Gobernanza de datos**: conocimiento de privacidad de datos, requisitos de residencia de datos y marcos de gobernanza
* **Habilidades de backend/scripting**: Python (preferido) o Go para automatización, herramientas y scripts operativos
* Kubernetes y orquestación de contenedores en producción
* Administración sólida de Linux/Unix y scripting (Bash, Python)
* Plataformas CI/CD: GitHub Actions, GitLab CI, Jenkins o similares
* Prácticas de control de versiones y GitOps
* Habilidades sólidas de resolución de problemas y depuración
* Dominio fluido del inglés (el español es un plus)
**Deseable**
* Competencia en Python para automatización y herramientas internas
* Experiencia con **plataformas de IA en la nube** (Vertex AI, Azure ML, AWS SageMaker)
* Experiencia con malla de servicios (service mesh) (Istio, Linkerd) o puertas de enlace API (API gateways)
* Experiencia con cargas de trabajo GPU e infraestructura para aprendizaje automático (ML)
* FinOps y optimización de costos en la nube
* Experiencia con marcos de cumplimiento (SOC 2, ISO 27001, HIPAA, FedRAMP)
* Operaciones de bases de datos: administración de PostgreSQL, Redis
* Experiencia con FastAPI o frameworks similares para herramientas internas
* Contribuciones a proyectos de infraestructura de código abierto
* Antecedentes en industrias de hardware o semiconductores
**Modalidad de trabajo y expectativas de ubicación:**
* **Modalidad del equipo:**
*Híbrida. Abierta al trabajo remoto*
* **Ubicación principal:**
Zona horaria preferible: UE
* **Expectativas presenciales:**
Este puesto puede ser híbrido o remoto. En modalidades híbridas, esperamos aproximadamente 2 días a la semana en la oficina (con flexibilidad). Si trabaja de forma remota, podría requerirse viajar ocasionalmente a nuestras oficinas de Barcelona o Boston.
* **Nota del gestor de contratación:**
Dado que una parte significativa del equipo trabaja de forma remota, estamos abiertos a acuerdos laborales flexibles, incluyendo opciones híbridas o totalmente remotas, según la ubicación y las necesidades del equipo.
**¿Por qué unirse a nosotros?**
En Axiomatic_AI, trabajará con tecnología que impulsa la innovación en IA para aplicaciones científicas e ingenieriles, alineada con nuestra misión 30X30.
Esta es su oportunidad de contribuir al desarrollo de nuevas arquitecturas de IA capaces de razonar de forma coherente y producir soluciones interpretables y verificables. Así, podrá ver cómo esas ideas se convierten en productos comerciales que moldearán el futuro del hardware y la computación, mientras colabora con un equipo global de ingenieros y especialistas en IA.
Creemos en impulsar los límites de lo posible y buscamos constantemente redefinir la intersección entre la IA, con especial énfasis en la consistencia formal. Si está listo para llevar su experiencia en inteligencia artificial y física al siguiente nivel, ¡queremos conocerlo!
*¿Le preocupa no cumplir todos los requisitos? Estudios indican que las mujeres y las personas de color tienen menos probabilidades de postularse a empleos a menos que cumplan todos los requisitos listados. En Axiomatic_AI, nos comprometemos a crear un entorno laboral diverso, inclusivo y auténtico. Si este puesto le entusiasma pero su trayectoria no coincide perfectamente con cada calificación, ¡le animamos a postularse de todas formas! Podría ser el candidato ideal para este puesto o para otra oportunidad con nosotros.*