知识卡片
Hadoop与MPP数据库对比之存储多样性:读时模式与数据湖
内容
MPP(大规模并行处理)数据库要求数据在导入前先按特定模型(关系、文档等)仔细建模,这种前期建模能带来高质量的规整数据,但也拖慢了跨组织收集数据的速度;分布式文件系统里的文件则只是无差别的字节序列,可以承载数据库记录、文本、图片、传感器读数、基因组序列等任意数据形态,因而Hadoop允许把数据不加区分地先转储进HDFS,把”如何解释这些数据”的决定推迟到之后(这正是[[读时模式与写时模式的权衡及适用场景]]中读时模式思路的组织级放大版)。这种做法有个形象的名字叫寿司原则——”原始数据更好”:不加区分地转储数据,把解释数据的负担从生产者转移给消费者,对于生产者和消费者分属不同团队、优先级不同的组织尤其有利,甚至同一份原始数据可能根本不存在唯一”理想”的模型,不同用途各有各的合适视角。这套以原始形式集中收集、后续再逐步建模的存储策略,就是”数据湖”(或称企业数据中心)概念的由来,也是Hadoop常被用来实现ETL过程(原始数据落地→清洗转换→导入MPP数据仓库做分析)的原因。
参考来源
- 位置:《数据密集型应用系统设计》第十章《批处理》"Hadoop与分布式数据库的对比""存储多样性"(源文件:_epub-src/ch10_split_002.html)
- 结论依据:原文对比MPP数据库要求前期建模与分布式文件系统承载任意格式数据的差异,引出读时模式方法、寿司原则"原始数据更好"以及数据湖概念,说明Hadoop常被用于ETL的原始数据落地阶段,直接支撑本卡片结论。
- 原始内容:Hadoop开放了将数据不加区分地转储到HDFS的可能性,允许后续再研究如何进一步处理……这种方法被称为寿司原则:"原始数据更好"……因此,Hadoop经常被用于实现ETL过程。