课题基金 / 基金详情

複数の調音運動データを中間情報とするマルチモーダル音声合成

複数の調音運動データを中間情報とするマルチモーダル音声合成
使用多个发音运动数据作为中间信息的多模态语音合成
批准号:
22K12100
负责人:
桂田 浩一
金额:
$2.58万
依托单位:
依托单位国家:
日本
项目类别:
Grant-in-Aid for Scientific Research (C)
财政年份:
2022
资助国家:
日本
项目状态:
未结题
起止时间:
2022-04-01 至 2027-03-31

项目摘要

项目成果

桂田 浩一的其他基金

相似基金

相关文献

中文摘要
翻译
2022年度は主にrtMRI動画像データからの音声合成法について検討した.本年度は特に,(1)rtMRI動画像からメルケプストラムのみを推定してworldボコーダによって音声を合成する方法と,(2)rtMRI動画像からメルスペクトログラムを推定してニューラルボコーダによって音声を合成する方法の2種類を検討した.(1)のメルケプストラムを推定する方法では声道形状パラメータ(口や舌の形)のみを推定し,声の高さを制御する声帯振動に相当するパラメータは同時収録した音声から取得していた.これに対して,(2)のメルスペクトログラムを推定する方法では声道形状パラメータに加えて声帯振動パラメータも推定することから声帯振動が撮影できないrtMRI動画像からは推定が困難であることが予想された.まず,(1)のメルケプストラムを推定する方法では,転置畳み込みニューラルネットワークの導入により時間分解能を向上し,音声を精度よく合成できることが確認できた.特に音素毎にメルケプストラムの精度を確認したところ,従来手法と比べて破裂音(/b/や/t/のように発音の直前に空気の流れを止めて発音する音)のメルケプストラム推定が良好に行えていることが確認でき,rtMRI動画像には含まれにくい閉鎖の瞬間を転置畳み込みニューラルネットワークで補完できていることが確認できた.(2)のメルスペクトログラムを推定する方法では,困難であると思われた声帯振動が良好に取得でき,合成音の基本周波数(声帯振動の周期に対応するパラメータ)が良好に取得できていることが確認できた.発声を声帯振動と声道形状で説明する従来のソース・フィルタモデルでは原理的に不可能であろう推定ができていることから,今後は良好に基本周波数が推定できた理由について分析を進める予定である.
英文摘要
2022年度は主にrtMRI動画像データからの音声合成法について検討した.本年度は特に,(1)rtMRI動画像からメルケプストラムのみを推定してworldボコーダによって音声を合成する方法と,(2)rtMRI動画像からメルスペクトログラムを推定してニューラルボコーダによって音声を合成する方法の2種類を検討した.(1)のメルケプストラムを推定する方法では声道形状パラメータ(口や舌の形)のみを推定し,声の高さを制御する声帯振動に相当するパラメータは同時収録した音声から取得していた.これに対して,(2)のメルスペクトログラムを推定する方法では声道形状パラメータに加えて声帯振動パラメータも推定することから声帯振動が撮影できないrtMRI動画像からは推定が困難であることが予想された.まず,(1)のメルケプストラムを推定する方法では,転置畳み込みニューラルネットワークの導入により時間分解能を向上し,音声を精度よく合成できることが確認できた.特に音素毎にメルケプストラムの精度を確認したところ,従来手法と比べて破裂音(/b/や/t/のように発音の直前に空気の流れを止めて発音する音)のメルケプストラム推定が良好に行えていることが確認でき,rtMRI動画像には含まれにくい閉鎖の瞬間を転置畳み込みニューラルネットワークで補完できていることが確認できた.(2)のメルスペクトログラムを推定する方法では,困難であると思われた声帯振動が良好に取得でき,合成音の基本周波数(声帯振動の周期に対応するパラメータ)が良好に取得できていることが確認できた.発声を声帯振動と声道形状で説明する従来のソース・フィルタモデルでは原理的に不可能であろう推定ができていることから,今後は良好に基本周波数が推定できた理由について分析を進める予定である.
期刊论文(0)
专著(0)
科研奖励(0)
会议论文
Conformerを用いた早期結合型マルチモーダル音声認識モデルの提案
使用Conformer的早期组合多模态语音识别模型的提案
DOI: --
发表时间: 2022
期刊:
影响因子: --
作者: [Hiroaki Uetani, Naoya Suzuki, and Atsutoshi Ikeda, 種田基希,池田篤俊, 大谷 祐人,澤田 隼,大村 英史,桂田 浩一, 大谷 祐人,澤田 隼,大村 英史,桂田 浩一, 佐藤 駿,澤田 隼,大村 英史,桂田 浩一, 丹治 涼,澤田 隼,大村 英史,桂田 浩一, 青木 伸和,澤田 隼,大村 英史,桂田 浩一]
通讯作者: 青木 伸和,澤田 隼,大村 英史,桂田 浩一
real-time MRI 調音運動データからの end-to-end 音声合成
根据实时 MRI 发音运动数据进行端到端语音合成
DOI: --
发表时间: 2023
期刊:
影响因子: --
作者: [Hiroaki Uetani, Naoya Suzuki, and Atsutoshi Ikeda, 種田基希,池田篤俊, 大谷 祐人,澤田 隼,大村 英史,桂田 浩一, 大谷 祐人,澤田 隼,大村 英史,桂田 浩一]
通讯作者: 大谷 祐人,澤田 隼,大村 英史,桂田 浩一
DOI: --
发表时间: 2022
期刊:
影响因子: --
作者: [Hiroaki Uetani, Naoya Suzuki, and Atsutoshi Ikeda, 種田基希,池田篤俊, 大谷 祐人,澤田 隼,大村 英史,桂田 浩一, 大谷 祐人,澤田 隼,大村 英史,桂田 浩一, 佐藤 駿,澤田 隼,大村 英史,桂田 浩一, 丹治 涼,澤田 隼,大村 英史,桂田 浩一]
通讯作者: 丹治 涼,澤田 隼,大村 英史,桂田 浩一
real-time MRIで収録した調音運動に基づくend-to-end音声合成
基于实时 MRI 记录的发音运动的端到端语音合成
DOI: --
发表时间: 2023
期刊:
影响因子: --
作者: [Hiroaki Uetani, Naoya Suzuki, and Atsutoshi Ikeda, 種田基希,池田篤俊, 大谷 祐人,澤田 隼,大村 英史,桂田 浩一]
通讯作者: 大谷 祐人,澤田 隼,大村 英史,桂田 浩一
対話文脈の再推定メカニズムを備えた柔軟なモルチモーダル対話システムの構築
  • 批准号:
    17700185
  • 项目类别:
    Grant-in-Aid for Young Scientists (B)
  • 资助金额:
    $2.18万
  • 财政年份:
    2005
  • 负责人:
    桂田 浩一
  • 依托单位:
多種多様な端末の利用を可能にするMMIアーキテクチャの設計と各種端末での実装
  • 批准号:
    14780323
  • 项目类别:
    Grant-in-Aid for Young Scientists (B)
  • 资助金额:
    $1.86万
  • 财政年份:
    2002
  • 负责人:
    桂田 浩一
  • 依托单位:
海外基金