知识卡片
画像数仓存储引擎分工
内容
用户画像系统的存储选型应按访问模式分工:Hive 承接批量计算和全量仓库,MySQL 存元数据、监控和结构化报表数据,HBase 服务线上单点查询,Elasticsearch 支撑复杂条件圈人与多维透视。关键不是哪个数据库更好,而是查询需要批处理、结构化报表、低延迟点查,还是复杂检索;HBase 与 Elasticsearch 具体如何配合完成复杂检索,见[[KV存储加全文索引的分离架构]]。
参考来源
- 位置:《用户画像:方法论与工程化解决方案》第1章《用户画像基础》(源文件:_epub-src/OEBPS/text00006.html)
- 结论依据:原文围绕“中间的虚线框即为用户画像建模的主要环节,用户画像不是产生数据的源头,而是对基于数据仓”给出定义、场景或处理方式,支撑卡片对“画像数仓存储引擎分工”的概括。
- 原始内容:中间的虚线框即为用户画像建模的主要环节,用户画像不是产生数据的源头,而是对基于数据仓库ODS层、DW层、DM层中与用户相关数据的二次建模加工。在ETL过程中将用户标签计算结果写入Hive,由于不同数据库有不同的应用场景,后续需要进一步将数据同步到MySQL、HBase、Elasticsearch等数据库中。