知识卡片

现象与原因的区分是监控信噪比核心

普通读书笔记卡 · 1573

内容

构建高信噪比监控系统最重要的一步,是把”什么东西坏了”(现象)和”为什么坏了”(原因)严格分开: 报警应主要盯着现象,因为现象直接对应用户是否受影响;原因分析应留给调试阶段的辅助工具,拿去 触发紧急警报只会让同一次故障重复报警、制造噪声。现象和原因不是绝对身份而是相对位置——数据库 读取慢是数据库团队看到的现象,却是前端团队排查网站变慢时看到的原因。参见 [[监控只应产生三类输出]]。

参考来源

- 位置:《SRE:Google运维解密》第6章《分布式系统的监控》"现象与原因"一节(源文件:_epub-src/OEBPS/Text/0008_0004.xhtml) - 结论依据:原文指出"‘现象’和‘原因’的区分是构建信噪比高的监控系统时最重要的概念",并用数据库延迟的例子说明同一数据在不同监控视角中角色会互换。 - 原始内容:"‘什么东西出故障了’即为现象(symptom):‘为什么’则代表了原因……‘现象’和‘原因’的区分是构建信噪比高的监控系统时最重要的概念……数据库读操作很缓慢是数据库SRE检测到的一个现象。然而,对前端SRE来说,他们看到的是网站缓慢,数据库读操作的缓慢则是原因。"