聞き手モデルに基づく能動的音声合成に関する研究
聞き手モデルに基づく能動的音声合成に関する研究
批准号:
18J22090
负责人:
齋藤 佑樹
金额:
$1.6万
依托单位:
依托单位国家:
日本
项目类别:
Grant-in-Aid for JSPS Fellows
财政年份:
2018
资助国家:
日本
项目状态:
已结题
起止时间:
2018-04-25 至 2021-03-31
中文摘要
本研究課題では、人間の音声知覚を統計的にモデル化し、多様な音声を自在に生成・制御可能な音声合成技術の実現を目指している。具体的には、音声合成技術により生成される合成音声の高品質化に加え、所望の合成音声を生成するために用いる、音声合成に対する補助的な入力(例えば、音声の話者を表す特徴量)の解釈性の低さといった従来技術の問題点を解決する。このような技術は、音声バーチャルリアリティによる身体的制約を超えた自己表現の拡張や、実際に利用される環境に適応可能な音声合成技術の実現に応用できると考える。今年度は特に、①利用者の主観的印象のグラフ表現を用いた話者ベクトル学習、 ②主観的印象スコア収集と話者ベクトル学習を反復するactive learningの2つに取り組んだ。①では、複数話者間の知覚的な類似度という関係性をグラフで表現し、深層学習に基づくグラフ表現学習により話者を表す特徴量(話者ベクトル)を学習する手法を提案した。実験的評価により、グラフ学習により得られた話者ベクトルが合成音声の自然性改善に最も有効であることを示した。この研究成果は、日本音響学会 粟屋 潔学術奨励賞を受賞している。②では、話者間類似度の知覚評価と話者ベクトル学習を反復し、解釈しやすい話者ベクトルを少ない計算コスト・評価コストで学習する手法を提案した。課題遂行最終年度である本年度は、研究成果の総括も行った。これまでの研究成果をまとめた原著論文は、音声信号処理分野におけるフラッグシップ論文誌であるIEEE/ACM TASLP誌に採録された。さらに、本研究課題の研究成果を含めて作成した博士論文は非常に高く評価され、東京大学 大学院情報理工学研究科において、各専攻から最も優れた博士課程学生を1名ずつ選出して授与される研究科長賞を受賞した。
英文摘要
本研究課題では、人間の音声知覚を統計的にモデル化し、多様な音声を自在に生成・制御可能な音声合成技術の実現を目指している。具体的には、音声合成技術により生成される合成音声の高品質化に加え、所望の合成音声を生成するために用いる、音声合成に対する補助的な入力(例えば、音声の話者を表す特徴量)の解釈性の低さといった従来技術の問題点を解決する。このような技術は、音声バーチャルリアリティによる身体的制約を超えた自己表現の拡張や、実際に利用される環境に適応可能な音声合成技術の実現に応用できると考える。今年度は特に、①利用者の主観的印象のグラフ表現を用いた話者ベクトル学習、 ②主観的印象スコア収集と話者ベクトル学習を反復するactive learningの2つに取り組んだ。①では、複数話者間の知覚的な類似度という関係性をグラフで表現し、深層学習に基づくグラフ表現学習により話者を表す特徴量(話者ベクトル)を学習する手法を提案した。実験的評価により、グラフ学習により得られた話者ベクトルが合成音声の自然性改善に最も有効であることを示した。この研究成果は、日本音響学会 粟屋 潔学術奨励賞を受賞している。②では、話者間類似度の知覚評価と話者ベクトル学習を反復し、解釈しやすい話者ベクトルを少ない計算コスト・評価コストで学習する手法を提案した。課題遂行最終年度である本年度は、研究成果の総括も行った。これまでの研究成果をまとめた原著論文は、音声信号処理分野におけるフラッグシップ論文誌であるIEEE/ACM TASLP誌に採録された。さらに、本研究課題の研究成果を含めて作成した博士論文は非常に高く評価され、東京大学 大学院情報理工学研究科において、各専攻から最も優れた博士課程学生を1名ずつ選出して授与される研究科長賞を受賞した。
期刊论文(0)
专著(0)
科研奖励(0)
会议论文
登录
查看更多内容
SMASHコーパス:ゲーム動画の後付け実況解説音声収録に基づく自発発話音声コーパス
SMASH Corpus:基于游戏视频后录制解说音频的自发语音语料库
DOI:
--
发表时间:
2020
期刊:
影响因子:
--
作者:
[齋藤 佑樹, 高道 慎之介, 猿渡 洋]
通讯作者:
猿渡 洋
Non-parallel and many-to-many voice conversion using variational autoencoders integrating speech recognition and speaker verification
使用集成语音识别和说话人验证的变分自动编码器进行非并行和多对多语音转换
DOI:
10.1250/ast.42.1
发表时间:
2021
期刊:
Acoustical Science and Technology
影响因子:
0.7
作者:
[Saito Yuki, Nakamura Taiki, Ijima Yusuke, Nishida Kyosuke, Takamichi Shinnosuke]
通讯作者:
Takamichi Shinnosuke
音素事後確率を用いた多対一音声変換のための音声認識・生成モデルの同時敵対学習
使用音素后验概率进行多对一语音转换的语音识别和生成模型的同步对抗学习
DOI:
--
发表时间:
2019
期刊:
影响因子:
--
作者:
[齋藤 佑樹,阿久澤 圭, 橘 健太郎]
通讯作者:
橘 健太郎
DOI:
10.1109/icassp.2018.8461384
发表时间:
2018-04
期刊:
2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)
影响因子:
--
作者:
[Yuki Saito;Yusuke Ijima;Kyosuke Nishida;Shinnosuke Takamichi]
通讯作者:
Yuki Saito;Yusuke Ijima;Kyosuke Nishida;Shinnosuke Takamichi
主観的話者間類似度のグラフ埋め込みに基づくDNN話者埋め込み
基于主观说话人间相似度的图嵌入的 DNN 说话人嵌入
DOI:
--
发表时间:
2020
期刊:
影响因子:
--
作者:
[齋藤 佑樹, 高道 慎之介, 猿渡 洋]
通讯作者:
猿渡 洋
共 13 条
eスポーツ理解に向けた実況解説音声の分析及び音声合成アルゴリズムの開発
-
批准号:22K17945
-
项目类别:Grant-in-Aid for Early-Career Scientists
-
资助金额:$3.0万
-
财政年份:2022
-
负责人:齋藤 佑樹
-
依托单位:
訪問リハにおける利用者の活動・参加を促進する目標設定プロセスの理論化と実証研究
-
批准号:21K11045
-
项目类别:Grant-in-Aid for Scientific Research (C)
-
资助金额:$2.66万
-
财政年份:2021
-
负责人:齋藤 佑樹
-
依托单位:
通所・訪問リハの漫然と続く機能訓練の改善に向けた目標設定プロセスの検討
-
批准号:20K19402
-
项目类别:Grant-in-Aid for Early-Career Scientists
-
资助金额:$2.75万
-
财政年份:2020
-
负责人:齋藤 佑樹
-
依托单位:
海外基金