知识卡片

状态支撑连续计算

专业/工作 · 501.f

内容

流计算需要跨事件保存中间结果,状态让窗口聚合、去重、会话识别等逻辑可持续推进(详见[[状态保存业务记忆]]);Checkpoint 则把状态定期备份,故障后恢复(详见[[Checkpoint备份本地状态]])。发散:无状态流处理只是管道,有状态才开始接近业务记忆。

参考来源

- 位置:《Flink原理与实践》第1章《大数据技术概述》(源文件:_epub-src/OEBPS/Text/chapter04.xhtml) - 结论依据:原文围绕“在流处理中,Checkpoint主要保存状态数据”给出定义、流程、对比或限制条件,本卡片据此提炼其可迁移的框架机制,并补充了使用边界或工程启发。 - 原始内容:将中间数据保存下来。当计算任务出现问题,重启后可以根据Checkpoint中保存的数据重新恢复任务。在流处理中,Checkpoint主要保存状态数据。 1.5.4 数据一致性保障 流处理任务可能因为各种原因出现故障,比如数据量暴涨导致内存溢出、输入数据发生变化而无法解析、网络故障、集群维护等。事件进……