知识卡片
惊群效应:同步重试如何放大成系统性崩溃
内容
黑色星期五发布时后端订单系统响应变慢,超时客户端开始集体重试,这些重试请求又进一步压垮了本已吃紧的服务器,形成恶性循环——这就是惊群问题:大量客户端同时等待同一事件,又几乎同时做出相同反应,系统被这股同步的重试洪峰击穿。团队的应对不是修后端,而是在前端把重试等待时间拉长,让请求错峰到达。发散:很多雪崩式故障根源不在第一次出错的地方,而在所有客户端不约而同做出同一反应,把小故障放大成系统性崩溃。
参考来源
《独角兽项目:数字化转型时代的开发传奇》第15章《11 月 25 日,星期二》