Paperphyte/Ordlista/Site Reliability Engineering (SRE)

Vad är Site Reliability Engineering (SRE)?

SRE är ett sätt att göra drift systematisk och mätbar: tillförlitlighet uttrycks i mål (SLO:er) och felbudgetar, och teamet arbetar aktivt med larm, automatisering och förbättringar i stället för reaktiv brandsläckning.

Begreppet kommer från Google, som beskriver SRE som ”vad som händer när man ber en mjukvaruingenjör designa en driftfunktion”. Kärnidén är felbudgeten: när tillgängligheten är bättre än målet får teamet ta risk och leverera fort; när budgeten är förbrukad prioriteras stabilitet.

Ett bra on-call-upplägg är mer än att någon har jour: tydliga larm som går att agera på, runbooks för återkommande problem och mandat att förbättra systemet efter incidenter.

Säg hej

Har du ett problem värt att lösa?

Chatta med oss på WhatsApp. Vi svarar inom 48 timmar.