知识卡片

告警应针对症状而非资源使用率

专业/工作 · 1212.h

内容

判断是否需要告警的关键问题是”服务是否还在做它该做的事”,而不是某个操作系统级指标是否超过阈值——如果一个先天资源敏感型服务(如 MySQL)持续占满 CPU 但响应时间仍在可接受范围内,这就不是问题。操作系统指标(CPU、内存等)对诊断和性能分析依然至关重要,因为能帮助发现影响性能的底层波动和趋势,但在绝大多数时候不值得叫醒一个人,除非有明确理由证明它已经或即将影响实际服务质量。发散:这是”监控症状还是监控原因”的取舍——告警应该锚定[[从用户角度开始监控最有效|用户能感知的影响面]],原因层面的指标留给诊断阶段按需查看,而不是倒置成两者都拿来触发寻呼。

参考来源

《监控运维实践 原则与策略-2021》第1章《监控反模式》