知识卡片

MapReduce边界

普通读书笔记卡 · 1776

内容

MapReduce 把计算拆成 Map 局部处理、Shuffle 重分布和 Reduce 聚合,屏蔽容错与调度细节。它适合一次性批处理,却不适合强迭代、低延迟或复杂多阶段依赖。

参考来源

- 位置:《大数据日知录:架构与算法》第11章《大规模批处理系统》"11.3 DAG计算模型"引言部分(源文件:_epub-src/OEBPS/text00016.html) - 结论依据:原文明确"MapReduce机制本质上是由Map和Reduce序列两阶段构成的……只有所有Map任务执行完成才能开始Reduce阶段的任务……MapReduce对于子任务之间复杂的交互和依赖关系缺乏表达能力",且"其设计初衷就是高吞吐、高容错的批处理系统",说明其适用于一次性批处理而非复杂多阶段依赖。 - 原始内容:MapReduce机制本质上是由Map和Reduce序列两阶段构成的,之所以说是序列的,是因为尽管Map阶段和Reduce阶段都支持大规模并发,但是在Map阶段有个任务同步过程,只有所有Map任务执行完成才能开始Reduce阶段的任务……MapReduce对于子任务之间复杂的交互和依赖关系缺乏表达能力……其设计初衷就是高吞吐、高容错的批处理系统。