知识卡片

音素作为中间单元解决单词粒度建模稀疏性

专业/工作 · 61.a

内容

声学模型要建模”给定单词序列,得到这段声音的概率”,但单词作为建模单元太大:任何一个单词的语音样本在训练数据里都是有限的,直接对单词建声学参数会严重稀疏。解决办法是把每个单词拆成音素序列,让声学模型转而对更小、可在不同单词间复用的音素单元建模,再用一个相对好统计的发音词典概率把音素序列和单词连接起来。这与[[贝叶斯定理拆解语音识别为两个可建模子问题]]是同一层逻辑的延伸:当某个建模粒度上数据太稀疏时,退一步找一个更细、可复用、组合数更少的单元,用组合的方式重建原始粒度的表达能力。

参考来源

《Kaldi语音识别实战》第1章《语音识别技术基础》