知识卡片

N元语法用截断历史换取可估计性

专业/工作 · 61.b

内容

一个词出现的概率理论上依赖它前面所有词构成的完整历史,但历史越长,这个联合分布需要的训练语料就越多,稀疏问题越严重。已出现的词对后续词的影响会随距离增大而衰减,这个经验事实支撑了一个实用简化:只保留最近N-1个词作为条件(实践中常取N=3或4),把无穷长的历史截断成固定窗口。这是马尔可夫假设在语言建模里的具体落地,本质是用”损失一部分长程依赖的建模能力”换”参数可以用有限语料估计出来”。发散:任何时序建模都会面对同样的取舍——窗口越长表达力越强,但每多一步历史,稀疏性和过拟合风险都在指数级增加。

参考来源

《Kaldi语音识别实战》第1章《语音识别技术基础》