知识卡片

三类数据的抽取路径差异

专业/工作 · 124

内容

知识抽取的难度和数据的结构化程度成反比:结构化数据(如关系数据库)只需要做格式映射, 把表结构映射成 RDF 三元组,难点仅在于嵌套表这类复杂结构的处理;半结构化数据(百科词条、 普通网页)知识结构相对固定,可以用”包装器”技术批量抽取,百科类数据尤其容易,因为它自带 Infobox 这样规整的字段;非结构化数据(纯文本、图像、音视频)没有任何预设结构,必须依赖 自然语言处理技术,拆解成实体抽取、属性抽取、关系抽取、事件抽取四个子任务分别处理。发散: 这解释了为什么知识图谱项目的工作量估算经常失控——团队容易按”数据量”线性估算成本,但 真正决定成本的是非结构化数据占比,这个变量往往在项目立项时被低估。

参考来源

《知识图谱技术与应用》第二章《通用知识图谱的技术要素》