课题基金 / 基金详情

End-to-End音声合成とEnd-to-End音声認識の統合システム

End-to-End音声合成とEnd-to-End音声認識の統合システム
端到端语音合成和端到端语音识别集成系统
批准号:
19J21031
负责人:
上乃 聖
金额:
$1.98万
依托单位:
依托单位国家:
日本
项目类别:
Grant-in-Aid for JSPS Fellows
财政年份:
2019
资助国家:
日本
项目状态:
已结题
起止时间:
2019-04-25 至 2022-03-31

项目摘要

项目成果

上乃 聖的其他基金

相似基金

相关文献

中文摘要
翻译
研究の目的はEnd-to-End音声合成とEnd-to-End音声認識を統合することで、適用対象(タスク、ドメイン)のテキストのみがある条件でも音声との対データを構成し、一括で学習するシステムを実現することである。今年度は音声認識と音声合成を効率的に統合でき、かつ音声認識の性能の低下が少ない表現を構成する方法の研究を行った。音声認識の性能の低下の原因のひとつとして挙げられるのが、実際に人間が話した音声(自然音声)と音声合成システムが生成した音声(合成音声)に差があることである。音声合成においては、通常テキストから人が聞くことのできる音声波形を作るのに必要な周波数スペクトル特徴量を予測するモデルを用いた後に、その周波数スペクトル特徴量を音声波形に変換するモデルを用いて、音声波形を生成する。周波数スペクトル特徴量は音声認識の訓練データとしても用いられ、生成された音声波形を再び周波数スペクトル特徴量に変換し、音声認識に用いる。音声波形に変換するモデルには自然音声と合成音声の差異を埋める効果があるが、この波形生成に非常に時間がかかるという問題がある。そこで今年度は音声波形に変換するモデルを用いずに周波数スペクトル特徴量上で直接差異を埋めるネットワークを構築した。提案手法では、生成された周波数スペクトル特徴量だけでなく、音声合成のタスクで利用可能な発話の音素系列情報も用いる。評価実験から、提案手法が音声波形に変換するよりも少ない処理時間で音声認識の拡張の効果が高いことを示し、また、発話の音素系列情報の利用も改善に重要であることを示した。
英文摘要
研究の目的はEnd-to-End音声合成とEnd-to-End音声認識を統合することで、適用対象(タスク、ドメイン)のテキストのみがある条件でも音声との対データを構成し、一括で学習するシステムを実現することである。今年度は音声認識と音声合成を効率的に統合でき、かつ音声認識の性能の低下が少ない表現を構成する方法の研究を行った。音声認識の性能の低下の原因のひとつとして挙げられるのが、実際に人間が話した音声(自然音声)と音声合成システムが生成した音声(合成音声)に差があることである。音声合成においては、通常テキストから人が聞くことのできる音声波形を作るのに必要な周波数スペクトル特徴量を予測するモデルを用いた後に、その周波数スペクトル特徴量を音声波形に変換するモデルを用いて、音声波形を生成する。周波数スペクトル特徴量は音声認識の訓練データとしても用いられ、生成された音声波形を再び周波数スペクトル特徴量に変換し、音声認識に用いる。音声波形に変換するモデルには自然音声と合成音声の差異を埋める効果があるが、この波形生成に非常に時間がかかるという問題がある。そこで今年度は音声波形に変換するモデルを用いずに周波数スペクトル特徴量上で直接差異を埋めるネットワークを構築した。提案手法では、生成された周波数スペクトル特徴量だけでなく、音声合成のタスクで利用可能な発話の音素系列情報も用いる。評価実験から、提案手法が音声波形に変換するよりも少ない処理時間で音声認識の拡張の効果が高いことを示し、また、発話の音素系列情報の利用も改善に重要であることを示した。
期刊论文(11)
专著(0)
科研奖励(0)
会议论文
Phone-informed refinement of synthesized mel spectrogram for data augmentation in speech recognition.
语音识别中数据增强的合成梅尔谱图的电话通知细化。
DOI: --
发表时间: 2022
期刊:
影响因子: --
作者: [Manami Hagihara, Tomoya Miyazaki, Kouichi Hirata, S.Ueno and T.Kawahara.]
通讯作者: S.Ueno and T.Kawahara.
Wave2word: 音声波形を入力とする単語単位end-to-end音声認識
Wave2word:使用语音波形作为输入的逐字端到端语音识别
DOI: --
发表时间: 2019
期刊:
影响因子: --
作者: [上乃聖, 三村正人, 坂井信輔, 河原達也]
通讯作者: 河原達也
wav2vec 2.0を用いた音声合成による音声認識のデータ拡張
使用wav2vec 2.0通过语音合成进行语音识别的数据扩展
DOI: --
发表时间: 2021
期刊:
影响因子: --
作者: [上乃聖, 河原達也]
通讯作者: 河原達也
音声認識のデータ拡張のための音素情報を用いた合成音声の強調
使用音素信息增强合成语音以进行语音识别的数据扩展
DOI: --
发表时间: 2022
期刊:
影响因子: --
作者: [上乃聖, 河原達也]
通讯作者: 河原達也
11
    音声認識のデータ拡張のための音声合成との密統合
    • 批准号:
      23K16944
    • 项目类别:
      Grant-in-Aid for Early-Career Scientists
    • 资助金额:
      $2.91万
    • 财政年份:
      2023
    • 负责人:
      上乃 聖
    • 依托单位:
    海外基金