知识卡片
命运共享决定监控分组粒度
内容
大型监控系统的分组层级依据”命运共享”原则设计:会因同一根源一起失败的实体应归入同一组。一个 任务的所有实例共享同一份配置文件,一旦配置出错就会一起失败,因此归为一组;一个分片下的多个 任务运行在同一数据中心、共享同一套网络结构,一旦网络故障就会同时失效,因此归为更大的一组。 按此设计的分层聚合结构,能让报警层级本身提示故障波及的边界。
参考来源
- 位置:《SRE:Google运维解密》第10章《基于时间序列数据进行有效报警》(源文件:_epub-src/OEBPS/Text/0009_0001.xhtml)
- 结论依据:原文明确用"命运共享(share of fate)"解释分组逻辑,并举例说明任务因共享配置文件、分片因共享数据中心网络而各自归组。
- 原始内容:这种分组结构一般是根据命运共享(share of fate)理念进行的。例如一个任务的所有实例是命运共享的,由于它们共享一个配置文件……而一个分片中的任务也是命运共享的,因为它们都运行在同一个数据中心中,而数据中心由于使用同一个网络结构而有可能同时失败。