知识卡片

数据架构的核心是数据编排:定归属、控流转、促聚合

结构图卡

内容

TOGAF对数据架构的定义(组织内外所需信息资源的结构、分类和关系)是从结构维度描述的;从功能维度看,数据架构涵盖数据模型、元数据、数据标准、数据质量、数据流转、数据安全等广泛内容——但拆到最核心的地方,数据架构关注的是需要准备哪些数据来支持系统落地。数据可以被视为一种知识类型,它的价值主要体现在流转和交换的过程中;但流转交换发生之前需要先解决一个前提问题——确定选择哪些数据进行流转和交换,这本质上是数据的编排问题。所以数据架构的核心就是数据编排,数据的价值要靠编排才能真正发挥出来、进而实现业务架构目标。数据编排包含几项具体任务:一是为数据定义归属,确定哪些数据属于哪个应用或系统——在数据建模阶段,还要为每个数据指定一个”主应用”,主应用相当于该数据的管家,负责数据的全生命周期管理(但主应用不一定包含数据的全部维度,有些维度可能以关联方式被其他应用修改,很多数据还需要设计副本,主副数据源关系要在数据分布视图里体现出来);二是确认数据应当如何流转和交换,通常按业务场景、数据规模、实时性、安全性等制定不同的数据流转”模板”(如联机数据流转架构、批量数据流转架构),并建设统一的数据流转平台来保证数据完整、安全、不延时;三是数据归集——数据天生具有聚合倾向,更大粒度、更多量级的数据往往能发挥更大作用,即便研发阶段无法完全集中处理,也要确保在数据归集时把具有聚合效应的数据存放到一起。数据架构的最终目标是安全、准确、快速地获取数据。

结构图

flowchart TB
  D["数据架构核心=数据编排"]
  D --> D1["数据定义归属<br/>(每个数据指定主应用=管家,负责全生命周期)"]
  D --> D2["数据流转/交换设计<br/>(按场景制定流转模板,建统一流转平台)"]
  D --> D3["数据归集(聚合效应)<br/>(粒度/量级越大,数据价值越大)"]
  D1 --> G["目标:安全/准确/快速地获取数据"]
  D2 --> G
  D3 --> G

参考来源

- 位置:《架构师启示录:知识模型、落地方法与思维模式》第7章《架构设计》之"7.2.1 数据架构是什么"、"7.2.2 数据架构的核心关注点"与"7.2.4 数据架构的设计方法"(源文件:_epub-src/EPUB/xhtml/chapter11.xhtml) - 结论依据:原文说明"数据架构的核心是数据编排,数据的价值需要通过数据编排发挥出来……数据编排的第一个重要任务是为数据定义归属……数据编排的第二个任务是确认数据应当如何流转和交换……数据归集也是数据编排的一个重要维度……主应用类似该数据的管家,负责数据的全生命周期管理", 直接支撑本卡关于数据编排三项任务的结构图。 - 原始内容:数据天生具有聚合倾向。较大粒度、更多量级的数据往往能发挥更大的作用。