知识卡片

领头人进程聚集埋下网络流量剧变风险

普通读书笔记卡 · 1628

内容

分片式共识系统里,每个分片的领头人进程承担的出向流量远大于其他副本,因为提案数据由领头人分发,其他节点只回复确认。若领头人选举算法只朝离客户端更近、机器性能更好这类局部最优方向优化,就容易让大量领头人不知不觉聚集到同一数据中心。这颗雷平时不会引爆,直到该数据中心发生大规模故障:所有领头人被迫同时切到其他数据中心,网络流量瞬间暴涨,一旦目标数据中心间带宽储备不够,故障恢复反而触发新一轮过载。

参考来源

- 位置:《SRE:Google运维解密》第23章《管理关键状态:利用分布式共识来提高可靠性》(源文件:_epub-src/OEBPS/Text/0009_0014.xhtml) - 结论依据:原文指出领头人进程使用更多计算资源尤其是网络容量,而选举算法若偏向客户端距离或机器性能等局部因素,会让领头人聚集在同一批数据中心;一旦该数据中心大规模故障,所有领头人被迫同时迁移,导致其余数据中心间网络流量剧烈变化。 - 原始内容:领头人进程会使用更多的计算资源,尤其是网络容量……某个算法可能会将领头人置于性能最好的机器上……如果三个数据中心中的某个数据中心有更好的机器,那么当这个数据中心出现问题时,将会有剧烈的网络流量变动……所有的领头人都应该切换到另外一个数据中心……其他两个数据中心的网络流量会突然增大。