知识卡片
流是连续批处理
内容
流处理可以看成对无界数据持续运行的计算:每个事件到来都推动视图变化。理解这一点后,实时层与批处理层不再是两种世界,而是延迟、状态和容错策略不同的计算形态。
参考来源
- 位置:《大数据系统构建:可扩展实时数据系统构建原理与最佳实践》第14章《队列和流处理》"14.3.1 Storm模型"一节(源文件:_epub-src/OEBPS/Text/104.xhtml)
- 结论依据:原文明确"Storm模型的核心是流……流是无限的元组序列……本质上,Storm模型是将流转换为新的流,可能会顺便更新数据库",并把Spout/Bolt/拓扑结构类比MapReduce的map/reduce任务,说明流处理是对无界数据持续运行的计算而非独立的处理范式。
- 原始内容:Storm模型的核心是流。如图14-8所示,流是无限的元组序列,元组是值的命名列表。本质上,Storm模型是将流转换为新的流,可能会顺便更新数据库……每个Spout或Bolt的实例被称为任务。Storm模型的关键在于任务本质上是并行的——就像MapReduce中的map和reduce任务本质上是平行的那样。