Sobre el puesto
La fiabilidad es una promesa que hacemos a cada usuario. Nuestros ingenieros de reliability de sitio son responsables de la disponibilidad, el rendimiento y la resiliencia de la plataforma HeroApply, y de las herramientas que permiten a cada ingeniero desplegar con confianza.
Trabajarás con equipos para diseñar ante el fallo, automatizar lo rutinario y hacer que los incidentes sean raros, cortos y bien comprendidos.
Lo que harás
- Tienes la responsabilidad de la disponibilidad, el rendimiento y la capacidad a lo largo de la plataforma.
- Diseñar y mantener infraestructura, herramientas de despliegue y observabilidad.
- Liderar la respuesta a incidentes y impulsar mejoras duraderas a partir de cada incidente.
- Colaborar con equipos de ingeniería en arquitectura confiable y segura.
- Automatiza el trabajo operativo y documenta claramente.
Lo que aportas
- Experiencia extensa en la operación de sistemas de producción a escala.
- Fundamentos sólidos en infraestructura, red y plataformas en la nube.
- Experto en monitoreo, alertas y gestión de incidentes.
- Un enfoque calmado y metódico cuando ocurren problemas.
- Una inclinación hacia la automatización y la documentación clara.
Bonos interesantes
- Experiencia con infraestructura como código.
- Fundamentos en seguridad o cumplimiento.
- Propio liderazgo de un programa de fiabilidad.

