A flexible framework for HMM based noise robust speech recognition using generalized parametric space polynomial regression

A flexible framework for HMM based noise robust speech recognition using generalized parametric space polynomial regression
复制标题

使用广义参数空间多项式回归的基于 HMM 的噪声鲁棒语音识别的灵活框架

DOI:
10.1007/s11432-011-4490-6
复制
发表时间:
2011-12
期刊:
Science China Information Sciences
影响因子:
--
通讯作者:
Wang Lan
Wang Lan
中科院分区:
其他
文献类型:
--
作者:
Cheng Ning;Liu XunYing;Wang Lan

文献摘要

参考文献

被引文献

相似文献

处理可变的、非平稳的环境噪声是自动语音识别(ASR)系统的一项具有挑战性的任务。为了解决这个问题,可以使用使用在不同噪声环境中收集的语音数据的多风格、噪声条件无关(CI)模型训练或不确定性解码技术。另一种方法是例如使用可变参数隐马尔可夫模型(VPHMM)来针对变化的噪声水平显式地近似高斯分量均值和方差参数的连续轨迹。本文研究了一种更一般化的变参数隐马尔可夫模型(GVP-HMM)。除了高斯分量均值和方差之外,它还可以为绑定线性变换提供更紧凑的轨迹建模。另一种噪声条件相关(CD)训练算法也被提出来处理训练噪声条件分布的偏差。一致的错误率增益,获得了传统的VP-HMM的平均值和方差的轨迹建模的媒体词汇普通话中文车载导航命令识别任务。
Handling variable, non-stationary ambient noise is a challenging task for automatic speech recognition (ASR) systems. To address this issue, multi-style, noise condition independent (CI) model training using speech data collected in diverse noise environments, or uncertainty decoding techniques can be used. An alternative approach is to explicitly approximate the continuous trajectory of Gaussian component mean and variance parameters against the varying noise level, for example, using variable parameter hidden Markov model (VPHMM). This paper investigates a more generalized form of variable parameter HMMs (GVP-HMM). In addition to Gaussian component means and variances, it can also provide a more compact trajectory modeling for tied linear transformations. An alternative noise condition dependent (CD) training algorithm is also proposed to handle the bias to training noise condition distribution. Consistent error rate gains were obtained over conventional VP-HMM mean and variance only trajectory modeling on a media vocabulary Mandarin Chinese in-car navigation command recognition task.
DOI: 10.1109/icslp.1996.607807
发表时间: 1996-10
期刊: Proceeding of Fourth International Conference on Spoken Language Processing. ICSLP '96
影响因子: --
作者:
T. Anastasakos;J. McDonough;R. Schwartz;J. Makhoul
通讯作者: T. Anastasakos;J. McDonough;R. Schwartz;J. Makhoul
DOI: 10.1109/asru.2001.1034578
发表时间: 2001-09
期刊: IEEE Workshop on Automatic Speech Recognition and Understanding, 2001. ASRU '01.
影响因子: --
作者:
M. Gales
通讯作者: M. Gales
DOI: 10.1109/tasl.2006.889791
发表时间: 2007-05
期刊: IEEE Transactions on Audio, Speech, and Language Processing
影响因子: --
作者:
Xiaodong Cui;Y. Gong
通讯作者: Xiaodong Cui;Y. Gong
DOI: 10.1109/asru.2005.1566532
发表时间: 2005-12
期刊: IEEE Workshop on Automatic Speech Recognition and Understanding, 2005.
影响因子: --
作者:
K. Yu;M. Gales
通讯作者: K. Yu;M. Gales
DOI: 10.1109/tasl.2007.901300
发表时间: 2007-08
期刊: IEEE Transactions on Audio, Speech, and Language Processing
影响因子: --
作者:
Kai Yu;M. Gales
通讯作者: Kai Yu;M. Gales