知识卡片
SLO反推on-call响应时限
内容
on-call响应时限并非拍脑袋而定,而是由服务的可用性目标反推出来的:若某面向用户服务的季度 可用性目标为99.99%,全季度可容忍的不可用时间仅13分钟,值班工程师就必须在分钟级别(约13分钟 内)响应故障;SLO更宽松的服务,响应时限可放宽到几十分钟。[[SLI/SLO/SLA三层区分]]由此从抽象 业务目标具体化为响应时限、值班排班规模等组织运作上的硬性约束。
参考来源
- 位置:《SRE:Google运维解密》第11章《on-call轮值》(源文件:_epub-src/OEBPS/Text/0009_0002.xhtml)
- 结论依据:原文用99.99%季度可用性目标反推出13分钟的容错窗口,进而得出响应时限必须是分钟级;并说明SLO更宽松时响应时限可放宽。
- 原始内容:如果一个面向最终用户的业务系统在每个季度想要达到99.99%的可用度,那么每个季度共有13分钟的不可用时间……这个要求说明了on-call工程师必须在分钟级别上响应生产事故(更确切地说,13分钟内)。如果一个系统的SLO更为宽松,那么响应时间可以在几十分钟内。