知识卡片

模型胜负取决于数据规模利用效率

专业/工作 · 60

内容

神经网络在语音识别中并非一开始就打败了隐马尔可夫模型配高斯混合模型(GMM-HMM)的组合,而是先以”混合模型”的身份局部替换GMM,用神经网络重新建模发音状态的输出概率。这个替换早在20世纪80年代就存在,却沉寂了二十多年,直到训练数据从几百小时涨到上万小时、算力足以支撑并行训练时才真正反超。决定新架构能否取代旧架构的,往往不是架构本身的先进性,而是它能否比旧架构更有效地把新增的数据规模转化为性能提升——这也是理解后来端到端模型崛起的同一条底层逻辑,参见[[端到端建模消除手工中间表示]]。

参考来源

《Kaldi语音识别实战》第1章《语音识别技术基础》