知识卡片
贝叶斯定理拆解语音识别为两个可建模子问题
内容
语音识别要求的是”给定声音,最可能的文字是什么”,但这个条件概率本身很难直接建模。用贝叶斯定理翻转方向后,它等价于求”给定文字生成这段声音的概率”乘以”这段文字本身出现的概率”的乘积最大值,因为声音本身出现的概率是个常数,求最大值时可以直接忽略。这样一个难以处理的联合判断,被拆成声学模型和语言模型两个独立可估计的部分。发散:这是”分而治之”在概率建模里的典型手法——当联合分布不可解时,找一个方向能把它拆成条件分布和边缘分布的乘积,前提是至少有一侧的条件概率比原问题更容易用数据估计。
参考来源
《Kaldi语音识别实战》第1章《语音识别技术基础》