知识卡片
依赖组件为系统可用性设下天花板
内容
一个服务的可用性不可能超过它所依赖的底层组件的可用性——比如 AWS EC2 单一云区域只承诺 99.95% 的 SLA(相当于每年约4小时停机),那么运行在单一区域上的应用理论上就不可能在不违反这条前提的情况下做出更高的可用性承诺,网络层同理,网络不可靠时上层服务器和应用也无法比网络本身更可靠。计算复杂架构下的整体可用性时,如果组件本身有冗余,精确算法要求把每个冗余组件的可用性都纳入计算,但这通常过于复杂且收益有限;更实用的做法是把每个组件当作黑盒整体计算可用性,忽略其内部冗余细节,直接回答真正关心的问题。发散:这解释了为什么”承诺比云厂商更高的可用性”本身就是一个危险信号——除非你比云厂商更懂如何做高可用基础设施。
参考来源
《监控运维实践 原则与策略-2021》第2章《监控设计模式》