知识卡片

短时平稳假设决定分帧参数

专业/工作 · 63

内容

语音识别对连续音频做特征提取前要先分帧,常见做法是每帧25ms、每隔10ms取一帧。这两个数字不是经验拍脑袋定的,而是由人类发声器官的运动速度决定的:发声器官的物理运动是缓慢的,所以在足够短的时间窗口(约25ms)内,可以近似认为声音信号的特性是不变的,即”短时平稳假设”。正是这个假设成立,才能把连续变化的声波转换成一串可以分别做特征提取、再用时序模型串起来的离散特征向量。发散:任何把连续信号切片处理的系统,切片长度的选择本质上都是在为一个”在这个尺度下信号近似平稳”的假设找边界,尺度选错,后面的建模逻辑都会失真。

参考来源

《Kaldi语音识别实战》第1章《语音识别技术基础》