知识卡片

MPP交互查询

普通读书笔记卡 · 1778.c

内容

Presto/Impala 这类 MPP 查询引擎把 SQL 拆成并行算子流水执行,尽量避免 MR 式作业边界。它们适合低延迟分析,但对内存、网络和失败恢复更敏感。

参考来源

- 位置:《大数据日知录:架构与算法》第13章《交互式数据分析》"13.3 Dremel系数据仓库"分类说明及"13.3.3 Impala"一节(源文件:_epub-src/OEBPS/text00018.html) - 结论依据:原文明确Dremel系(含Impala、Presto)"不仅参考了Dremel的设计思路,在很大程度上也融合了MPP并行数据库的设计思想",且"与Pig和Hive不同的是,Dremel并不将用户查询转换为若干MR任务来执行,而是通过Dremel自身的机制(类MPP并行数据库方式)对存储在磁盘中的数据直接进行扫描等数据处理操作,这也是其效率较高的重要原因之一"。 - 原始内容:很多系统不仅参考了Dremel的设计思路,在很大程度上也融合了MPP并行数据库的设计思想……目前比较流行的系统如Impala、Presto都被归于此类……与Pig和Hive不同的是,Dremel并不将用户查询转换为若干MR任务来执行,而是通过Dremel自身的机制(类MPP并行数据库方式)对存储在磁盘中的数据直接进行扫描等数据处理操作,这也是其效率较高的重要原因之一。