知识卡片
高基数高维度
内容
现代调试需要按用户ID、请求ID、版本、租户、区域等高基数字段组合观察。低基数指标适合看总体健康,却会把少数用户的真实痛苦抹平成平均值。发散:性能问题常藏在尾部,不在平均值里。
参考来源
- 位置:《可观测性工程》第1章《什么是可观测性》"1.5 高基数"及相关小节(源文件:_epub-src/OEBPS/011.xhtml)
- 结论依据:原文说明"高基数信息在识别用于调试或理解系统的数据时最有用。按字段[如用户ID、购物车ID、请求ID……]进行排序会更有效……你总是可以通过聚合采样高基数的值来获得较低基数的值……但反之不行",并举例通过高基数字段组合精确定位问题;对比传统监控只支持低基数聚合的局限。
- 原始内容:在数据库的概念中,基数是指包含在一个集合中的唯一值的数量……高基数信息在识别用于调试或理解系统的数据时最有用……能够根据唯一ID查询是在任何给定的"干草堆"中精确定位每一根具体"草秆"的最佳方法。你总是可以通过聚合采样高基数的值来获得较低基数的值,但反之不行。