知识卡片
微批模拟流式
内容
D-Stream 等系统把流式计算实现为对底层批处理引擎(如Spark)的连续微批调用,用批处理的编程模型模拟流式效果。这种”借批行流”的方式限制了原语丰富度,也因底层仍是批处理机制而拖累实时性。
参考来源
- 位置:《大数据日知录:架构与算法》第12章《流式计算》引言部分(源文件:_epub-src/OEBPS/text00017.html)
- 结论依据:原文明确"少数现代的流式计算系统(比如D-Stream)仅提供有限的编程原语供应用使用,这是由于其依赖更底层的Spark框架的计算机制导致的约束",并指出"D-Stream和Hadoop Online分别对底层的Spark和Hadoop框架及其批处理计算机制的依赖导致其实时性不佳等问题"。原书本章未讨论"批流结合架构""历史全量校准+实时增量"等Lambda架构式内容,故本卡改为只陈述book实际讨论的D-Stream案例,不外推未支撑的通用结论。
- 原始内容:也有少数现代的流式计算系统(比如D-Stream)仅提供有限的编程原语供应用使用,这是由于其依赖更底层的Spark框架的计算机制导致的约束,而这在很大程度上限制了其应用的广泛性……D-Stream和Hadoop Online分别对底层的Spark和Hadoop框架及其批处理计算机制的依赖导致其实时性不佳等问题。