知识卡片

端到端建模消除手工中间表示

专业/工作 · 60.a

内容

传统语音识别把任务拆成声学模型和语言模型两段,中间必须经过音素、三音子这类人工设计的建模单元做桥接。端到端系统(如用双向LSTM配CTC目标函数的方案)绕开了这层中间表示,在足够的数据支撑下直接把音频特征映射到文字。这不是单纯的模型结构升级,而是一种建模范式的转变:从”分阶段流水线+人工设计中间表示”转向”数据驱动的联合优化”。发散:这个转变模式在很多领域反复出现(比如推荐系统从特征工程转向表示学习),判断一个领域是否到了端到端替代分阶段流水线的时机,关键看数据量和算力是否已经能覆盖掉人工中间表示原本承担的先验知识。

参考来源

《Kaldi语音识别实战》第1章《语音识别技术基础》