知识卡片
MTTR-MTTF-MTBF三个可用性指标的区分
内容
三个容易混淆的指标各自回答不同的问题:平均无故障时间衡量系统平均能连续正常运行多久才出一次故障;平均修复时间衡量一次故障从发生到修复完成平均要花多久;平均失效间隔则是两次故障之间的平均时间,本质上约等于无故障时间加修复时间。把这三者放在一起看会发现,提升可用性有两条独立的路:一条是延长无故障时间(让系统更少坏),另一条是缩短修复时间(坏了以后更快修好),两条路径需要的工程投入完全不同——前者靠冗余设计和质量把控,后者靠自动化恢复和监控告警。发散:很多团队把精力全部押注在”减少故障”上,却忽视了”故障发生后多快能恢复”同样能大幅提升整体可用性,甚至往往后者的投入产出比更高,因为故障永远无法完全避免。
参考来源
《Linux开源存储全栈详解从Ceph到容器存储》第5章《存储安全》