知识卡片
数据仓库中间层设计原则
内容
标签开发到一定规模后,不同标签之间往往会重复读取、重复加工同一份上游数据,这时该不该抽一层中间表,需要先梳理标签的血缘依赖图,找到真正被多处共用的上游数据,而不是想当然地建。设计中间层前要想清楚四个问题:它对应的业务场景和目标是什么、能减少哪些重复计算、覆盖哪些分析维度、以及最重要的一点——一个试图同时服务所有业务场景的”万能中间层”往往不是好设计,反而会因为职责不清而难以维护。
参考来源
- 位置:《用户画像:方法论与工程化解决方案》第5章《开发性能调优》(源文件:_epub-src/OEBPS/text00088.html)
- 结论依据:原文围绕“在开发中间表前,首先需要梳理目前用户标签计算时依赖的上游数据仓库的表(如图5-5所示”给出定义、场景或处理方式,支撑卡片对“数据仓库中间层设计原则”的概括。
- 原始内容:在开发中间表前,首先需要梳理目前用户标签计算时依赖的上游数据仓库的表(如图5-5所示)和标签的血缘依赖(如图5-6所示)。