知识卡片

模式复用MR

普通读书笔记卡 · 1776.b

内容

求和、过滤、数据组织和 Join 都可表达成 MapReduce 模式。把业务问题套进模式不是机械翻译,而是判断哪些计算能局部化、哪些必须按键重分布。

参考来源

- 位置:《大数据日知录:架构与算法》第11章《大规模批处理系统》"11.2 常见的MapReduce计算模式"(求和模式等小节)(源文件:_epub-src/OEBPS/text00016.html) - 结论依据:原文归纳"求和模式"(数值求和、记录求和)等常见MapReduce计算模式,并具体说明"数值求和"以对象ID为Key、数值为Value,通过Shuffle将同Key传给同一Reducer做统计计算;"记录求和"则以累加对象ID形成队列,本质是把不同业务问题映射到"哪些能在Map阶段局部处理、哪些需要按Key在Shuffle阶段重分布"的判断上。 - 原始内容:对于海量数据来说,通过对相似数据进行简单求和、统计计算或者相似内容归并是非常常见的应用场景,求和模式即描述这类应用场景及其对应的MapReduce解决方案,根据求和对象的类型,可以细分为数值求和以及记录求和两种情况……通过Shuffle阶段,MapReduce将相同对象传递给同一个Reducer,Reducer则对相同对象的若干Value进行数学统计计算,得到最终结果。