知识卡片

信息量与熵:压缩的理论下限

普通读书笔记卡 · 1224

内容

一个符号的信息量由其出现概率决定:概率越低,信息量越大,需要的编码位数也越多(信息量=-log₂概率)。字母表所有符号信息量的加权平均称为”熵”,是这个概率分布下无损压缩的理论极限,只能逼近不能突破,只在预测概率与真实分布完全一致时才达到最大压缩。这解释了为什么压缩研究重心从”编码方法”转向”概率建模方法”——真正决定压缩上限的是模型对数据规律的刻画能力。

参考来源

- 位置:第2章《文本压缩》2.1节「模型」(源文件:_chapter-text/ch02.txt,对应_epub-src/OEBPS/text00008.html) - 结论依据:原文明确给出信息量公式I(s)=-log Pr[s],并说明熵H是压缩下限,只能逼近不能突破,直接支持卡片对信息量与熵关系及压缩理论下限的论述。 - 原始内容:"符号s的编码位数称为"符号的信息量"……I(s)=-logPr[s]位……假定符号以假设的概率值独立出现,H是压缩下限。它以每个字符占据的位数来度量,并且能以任何编码方式实现,这就是Claude Shannon著名的编码原理。"