Towards Signal-Based Instrumental Quality Diagnosis for Text-to-Speech Systems

Towards Signal-Based Instrumental Quality Diagnosis for Text-to-Speech Systems
复制标题

面向文本转语音系统的基于信号的仪器质量诊断

DOI:
--
复制
发表时间:
2008
影响因子:
3.9
通讯作者:
Sebastian Möller
Sebastian Möller
中科院分区:
工程技术2区
文献类型:
--
作者:
T. Falk;Sebastian Möller

文献摘要

被引文献

相似文献

在这封信中,描述了为文本转语音 (TTS) 系统开发基于信号的仪器质量测量的第一步。隐马尔可夫模型 (HMM) 在自然产生的语音上进行训练,可用作与文本和说话人无关的人工参考模型,用于评估合成语音信号。提出了一种在从合成语音中提取的感知特征和性别相关 HMM 参考模型之间计算的归一化对数似然度量,并被证明是多维 TTS 质量诊断的可靠参数。对合成语音数据进行主观评分的实验表明,所提出的方法在标记为总体印象、听力努力、自然度、连续性/流畅性和接受度的质量维度上获得了有希望的估计性能。
In this letter, the first steps toward the development of a signal-based instrumental quality measure for text-to-speech (TTS) systems are described. Hidden Markov models (HMM), trained on naturally-produced speech, serve as artificial text- and speaker-independent reference models against which synthesized speech signals are assessed. A normalized log-likelihood measure, computed between perceptual features extracted from synthesized speech and a gender-dependent HMM reference model, is proposed and shown to be a reliable parameter for multidimensional TTS quality diagnosis. Experiments with subjectively scored synthesized speech data show that the proposed measure attains promising estimation performance for quality dimensions labeled overall impression, listening effort, naturalness, continuity/fluency, and acceptance.