知识卡片
静态、半静态、自适应建模的取舍
内容
估计概率分布(建模)有三种策略:静态建模用固定通用概率表,不需额外传输但遇到分布迥异的文本效果会变差;半静态建模先扫描全文统计专属分布再传输模型,适配度高但要付出两趟扫描加传输代价;自适应建模从平缓分布出发动态调整,兼顾单趟扫描与适配,效果最好但解码必须从头开始,不适合需要随机访问的全文检索系统,参见[[分块压缩与随机访问的权衡]]中的同样矛盾。
参考来源
- 位置:第2章《文本压缩》2.2节「自适应模型」(源文件:_chapter-text/ch02.txt)
- 结论依据:原文分别定义静态建模(不考虑正在编码的文本内容)、半静态建模(预扫描全文再传输模型)、自适应建模(从平缓分布出发动态调整但不支持随机访问)三种策略及其代价,直接支持卡片对三者取舍的论述。
- 原始内容:"使用同样的模型而不考虑其正在编码的文本内容的方法称为"静态建模法"……解决的办法就是为每一个要压缩的文件建立一个特殊的模型……这种方法称为"半静态建模"……自适应建模是解决这些问题的一种优雅的方法,它以平缓的概率分布开始,随着遇到的符号的增多而逐步改变。"