Begreppet kommer från Google, som beskriver SRE som ”vad som händer när man ber en mjukvaruingenjör designa en driftfunktion”. Kärnidén är felbudgeten: när tillgängligheten är bättre än målet får teamet ta risk och leverera fort; när budgeten är förbrukad prioriteras stabilitet.
Ett bra on-call-upplägg är mer än att någon har jour: tydliga larm som går att agera på, runbooks för återkommande problem och mandat att förbättra systemet efter incidenter.