Kubernetes‑alapú platform üzemeltetése Klaszterek és node‑ok napi szintű kezelése (upgrade, patch, node cordon/drain, skálázás). Perzisztens tárolás (pl. CSI/Longhorn jellegű megoldás) üzemeltetése, alap szintű kapacitás‑tervezés. Megbízhatóság és SLO‑k támogatása Részvétel SLI/SLO‑k kialakításában és monitorozásában. Error budgetek követése, incidensek és trendek visszacsatolása a csapat felé. Observability és incident management Monitoring és loggyűjtő rendszerek használata és alap konfigurálása (dashboardok, riasztások). Részvétel on‑call rotációban: riasztások elsődleges kezelése, incidensek elhárítása runbookok alapján. Automatizáció és runbookok Deployment és konfiguráció automatizálásának támogatása (CI/CD, Git‑alapú folyamatok). Runbookok, üzemeltetési leírások készítése és karbantartása. Több szervezeti egység közötti együttműködés Napi munka során együttműködés mind a fejlesztői, mind az üzemeltetési és üzleti szereplőkkel. Javaslatok megfogalmazása a folyamatok és a platform megbízhatóságának javítására.
Senior Site Reliability Engineer
TOPdesk
Staff Software Engineer (Reliability & Platform)
Oneidentity
Site Reliability Engineer, Networking
Protex Ai
Site Reliability & Infrastructure Engineer
Instructure
Site Reliability Engineer
Cambridge Mobile Telematics
Senior Cloud Security Engineer
Tenarai Europe