知识卡片
短期忍受降级换长期修复
内容
当系统只能靠工程师连续救火维持高可用时,这种状态不可持续。Bigtable 团队曾主动把 SLO 目标 临时调低、关掉大量邮件警报,为修复底层长尾延迟问题争取时间,短期接受可控的可用性下降,换 长期稳定性提升。Gmail 团队也面对相似分歧:该不该写脚本自动应对已知调度器故障?反对者担心 补丁上线后根因修复被无限拖延。发散:应急手段是为根治争取时间还是替代根治,取决于压力缓解 后是否仍坚持修复优先级。
参考来源
- 位置:《SRE:Google运维解密》第6章《分布式系统的监控》"Bigtable SRE:警报过多的案例"和"Gmail:可预知的、可脚本化的人工干预"两节(源文件:_epub-src/OEBPS/Text/0008_0004.xhtml)
- 结论依据:原文描述 Bigtable 团队临时降低 SLO、改用75%百分位并关闭邮件警报以换取修复时间;Gmail 案例中团队成员担心自动化"hack"会使真正的修复优先级无限降低,两案例共同支撑"短期降级换长期修复"的结论。
- 原始内容:"团队临时将SLO目标降低,采用了请求延迟的75%百分位作为SLI。同时关闭了E-mail警报……该策略给团队带来了喘息空间,提供了一些时间修复Bigtable的长期问题……一些团队成员想要实现某种‘hack’从而为真正的修复方案争取时间,而另外一些成员则担心实现这个‘hack’会使得真正的修复优先级无限降低。"