知识卡片
文本图像压缩:把[[LZ77与LZ78的窗口取舍]]的字典思想搬到像素上
内容
扫描文档里同一字母往往重复出现几十上百次,逐像素压缩就是反复编码同一形状。文本图像压缩借用字典压缩思路:扫描出图像里每个连通黑色像素团块(标记),维护形状库,新标记去和库里已有形状比对,找到相似的只记录”第几号库形状+位置”,找不到才当新形状加入库。整份文档最终表示成较小形状库加一长串(库编号,坐标偏移),压缩比可达十几到上百倍,和LZ77/78结构完全同构,区别是符号从一维字符串变成二维像素块。
参考来源
- 位置:第7章《文本图像》7.1节前导(源文件:_chapter-text/ch07.txt,对应_epub-src/OEBPS/text00013.html)
- 结论依据:原文明确说明文本图像压缩要建立形状库,把图像中出现的标记用指向库的指针替换,直接支持卡片对字典思想同构性的论述。
- 原始内容:"文本图像压缩需要创建出现在图像中的形状库(libraray of shapes……出现在图像中的形状就会被指向图形库的指针替换……抽取每个标记后,将其与库中已知的符号比对……如果没有发现足够接近的匹配,这个标记被当做一个新符号……添加到库中。"