知识卡片

崩溃后降负载到远低于崩溃点才能恢复

普通读书笔记卡 · 1621

内容

一个服务在10,000 QPS正常运行,11,000 QPS时进入连锁故障,把负载降回崩溃前的9,000 QPS通常 无法恢复——这是反直觉的不对称现象。原因是崩溃后系统已进入另一种状态:只有一小部分实例还能 正常工作(如10%),能承受的总流量上限也相应缩小,必须把负载降到远低于原临界点(如1,000 QPS)才能让崩溃实例逐个恢复,再逐步爬升。发散:退出糟糕状态所需条件往往比维持良好状态苛刻 得多。

参考来源

- 位置:《SRE:Google运维解密》第22章《处理连锁故障》"服务不可用"一节(源文件:_epub-src/OEBPS/Text/0009_0013.xhtml) - 结论依据:原文举例"如果某个服务在10,000 QPS的水平下正常服务,但是当11,000 QPS的时候进入连锁故障模式,降低负载到9,000 QPS通常也无法恢复……如果10%的任务目前可以正常处理请求,那么请求速率必须降低到1,000 QPS才能使整个系统恢复稳定",直接支撑该不对称结论。 - 原始内容:如果某个服务在10,000 QPS的水平下正常服务,但是当11,000 QPS的时候进入连锁故障模式,降低负载到9,000 QPS通常也无法恢复。这是因为这时该服务仍然处于容量不足的状态……在这个例子里,如果10%的任务目前可以正常处理请求,那么请求速率必须降低到1,000 QPS才能使整个系统恢复稳定。