Über die Stelle
Reliability ist eine Versprechen, das wir jedem Benutzer geben. Unsere Site Reliability Engineers übernehmen die Verfügbarkeit, Leistung und Resilienz der HeroApply-Plattform sowie die Werkzeuge, die es jedem Engineer ermöglichen, mit Sicherheit zu arbeiten.
Sie arbeiten über verschiedene Teams hinweg, um für Fehlschläge zu konzipieren, die Routine zu automatisieren und zu machen, dass Störungen selten, kurz und gut verstanden sind.
Was Sie tun
- Eigene Verfügbarkeit, Leistung und Kapazität auf der Plattform.
- Builden und Wartung von Infrastruktur, Bereitstellung und Observability-Tools.
- Führen von Incident-Response und fördern nachhaltiger Verbesserungen aus jedem Incident.
- Arbeiten Sie mit Engineering-Teams an zuverlässigen, sicheren Architekturen.
- Automatisieren Sie operative Aufgaben und dokumentieren Sie sie klar.
Was Sie mitbringen
- Umfangreiche Erfahrung bei der Betriebssystembetreuung in großem Maßstab.
- Starke Ausbildung in Infrastruktur, Netzwerk und Cloud-Plattformen.
- Expertise in Überwachung, Warnungen und Incident-Management.
- Eine ruhige, methodische Haltung bei Problemen.
- Ein Bias zugunsten der Automatisierung und klarer Dokumentation.
Schön wäre, wenn
- Erfahrung mit Infrastruktur als Code.
- Sicherheits- oder Konformitätsausbildung.
- Vorbesitz eines Zuverlässigkeitsprogramms.

