知识卡片
分治是底层思想
内容
大数据系统的基础动作是把海量数据拆成可并行处理的小任务,再汇总结果。框架隐藏了分发、通信、失败恢复等复杂性。发散:MapReduce、Spark、Flink 的差异很大,但都绕不开“拆分-并行-合并”这条主线。
参考来源
- 位置:《Flink原理与实践》第1章《大数据技术概述》(源文件:_epub-src/OEBPS/Text/chapter04.xhtml)
- 结论依据:原文围绕“分而治之的处理思想”给出定义、流程、对比或限制条件,本卡片据此提炼其可迁移的框架机制,并补充了使用边界或工程启发。
- 原始内容:以下简称Spark),主要专注于批处理。 读完本章之后,读者可以了解以下内容。 大数据的特点、大数据分而治之的处理思想。 批处理和流处理的区别。 流处理的基础概念。 流处理框架的技术更迭和架构演进。 Flink开发的常用编程语言。 1.1 什么是大数据 1.1.1 大数据的5个“V” 大数据,顾名思……