知识卡片

内存DAG提速

普通读书笔记卡 · 1778.a

内容

Shark/Spark 类系统用内存缓存和 DAG 执行减少反复读写 HDFS 的成本。对迭代分析和交互查询来说,保留中间状态比每次从磁盘重建执行计划更关键。

参考来源

- 位置:《大数据日知录:架构与算法》第13章《交互式数据分析》"13.2 Shark系数据仓库"一节(源文件:_epub-src/OEBPS/text00018.html) - 结论依据:原文明确"Shark是Berkeley大学AMPLab实验室在Spark大数据处理协议栈上建立的支持交互式分析的数据仓库……采用RDD的处理模型来对数据进行高效处理……Shark很自然地获得了两个优势:其一是方便地将待处理数据放在内存,所以效率较高"。 - 原始内容:Shark是Berkeley大学AMPLab实验室在Spark大数据处理协议栈上建立的支持交互式分析的数据仓库……我们知道,Spark是比较适合解决迭代式机器学习问题的,采用RDD的处理模型来对数据进行高效处理。得益于此,Shark很自然地获得了两个优势:其一是方便地将待处理数据放在内存,所以效率较高。