知识卡片

Dataflow模型的四个核心设计问题

专业/工作 · 499.b

内容

Google在2015年发表论文《The dataflow model》,提出了一套统一流处理和批处理的系统框架,核心是把无界乱序数据的计算拆解成四个必须独立回答的问题:产出什么结果(业务逻辑本身,框架不预置)、计算哪个时间范围的数据(用窗口模型把无界流切成有限集合)、什么时候触发计算(用触发模型结合[[水位线与迟到数据的三种处理策略]]决定作业何时算完一批)、以及后续结果如何修正。这篇论文之所以被视为现代流计算的基石,是因为它第一次把”正确性、延迟、成本”三者的权衡显式拆成可独立设计的维度,而不是绑定在某一种具体实现里,Flink、Beam等框架的窗口/时间语义设计都直接承袭了这套思路。

参考来源

《Flink入门与实战》第2章《定义、架构与原理》