Next-generation audio and speech processing architectures based on deep learning
Next-generation audio and speech processing architectures based on deep learning
批准号:
22H03614
负责人:
徳田 恵一
金额:
$11.07万
依托单位国家:
日本
项目类别:
Grant-in-Aid for Scientific Research (B)
财政年份:
2022
资助国家:
日本
项目状态:
未结题
起止时间:
2022-04-01 至 2025-03-31
中文摘要
従来型のデジタル信号処理理論は、音声・オーディオ信号処理関連の研究分野における最も根本的な考え方として広く普及・定着しているが、単純なモデル構造による制約のため、その性能には限界があった。本研究では、深層学習に基づいて信号モデルを構成することにより、新しい形の音声信号生成技術を確立し、音声合成、音声符号化、声質変換、更には楽器音等のオーディオ音声信号生成への応用により、その有効性を検証することを目的とする。特に、多視点的・俯瞰的な観点から、音声波形生成に適したモデル構造を探求するとともに、「従来型モデル構造の部分導入」および「学習データ拡張による制御構造の内在化」のふたつのアプローチにより、従来型の音声波形生成手法の利点である「軽量性」、「制御性」を兼ね備えたモデル構造を明らかにすることを目指す。本年度に関しては、多視点的・俯瞰的な観点から、音声生成に適した深層学習モデル構造について検討を進めた。また、応用分野に依存しない形の検討を行い、続いて「音声合成・歌声合成」、「音声符号化」、「声質変換」の3つの主要応用分野に依存した検討を開始した。また、並行して、従来型のモデルの利点である「軽量性」、「制御性」の実現のため、「従来型モデル構造の部分導入」について検討し、微分可能な形の従来型の信号処理モジュールをGPU向きの並列実装することにより、ニューラルネットワークモデルと組み合わせながら、End2endに学習可能な手法を提案し、その有効性を確認した。実装のコア部分についてはオープンソースソフトウェアとして公開した。また、並行して「学習データ拡張による制御構造の内在化」に関しては、いくつかの方式について検討を進め、他手法との比較を行った。
英文摘要
従来型のデジタル信号処理理論は、音声・オーディオ信号処理関連の研究分野における最も根本的な考え方として広く普及・定着しているが、単純なモデル構造による制約のため、その性能には限界があった。本研究では、深層学習に基づいて信号モデルを構成することにより、新しい形の音声信号生成技術を確立し、音声合成、音声符号化、声質変換、更には楽器音等のオーディオ音声信号生成への応用により、その有効性を検証することを目的とする。特に、多視点的・俯瞰的な観点から、音声波形生成に適したモデル構造を探求するとともに、「従来型モデル構造の部分導入」および「学習データ拡張による制御構造の内在化」のふたつのアプローチにより、従来型の音声波形生成手法の利点である「軽量性」、「制御性」を兼ね備えたモデル構造を明らかにすることを目指す。本年度に関しては、多視点的・俯瞰的な観点から、音声生成に適した深層学習モデル構造について検討を進めた。また、応用分野に依存しない形の検討を行い、続いて「音声合成・歌声合成」、「音声符号化」、「声質変換」の3つの主要応用分野に依存した検討を開始した。また、並行して、従来型のモデルの利点である「軽量性」、「制御性」の実現のため、「従来型モデル構造の部分導入」について検討し、微分可能な形の従来型の信号処理モジュールをGPU向きの並列実装することにより、ニューラルネットワークモデルと組み合わせながら、End2endに学習可能な手法を提案し、その有効性を確認した。実装のコア部分についてはオープンソースソフトウェアとして公開した。また、並行して「学習データ拡張による制御構造の内在化」に関しては、いくつかの方式について検討を進め、他手法との比較を行った。
期刊论文(12)
专著(0)
科研奖励(0)
会议论文
登录
查看更多内容
DOI:
10.1109/icassp49357.2023.10095919
发表时间:
2022-12
期刊:
ICASSP 2023 - 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)
影响因子:
--
作者:
[Yukiya Hono;Kei Hashimoto;Yoshihiko Nankaku;K. Tokuda]
通讯作者:
Yukiya Hono;Kei Hashimoto;Yoshihiko Nankaku;K. Tokuda
半教師あり学習を用いた階層化生成モデルに基づく日本語 end-to-end 音声合成
基于使用半监督学习的分层生成模型的日语端到端语音合成
DOI:
--
发表时间:
2022
期刊:
影响因子:
--
作者:
[藤本崇人, 橋本佳, 南角吉彦, 徳田恵一]
通讯作者:
徳田恵一
自己教師あり学習による特徴抽出器とcoarse-fine変換を用いた少量学習データによる歌声変換
使用特征提取器使用少量训练数据进行歌声转换,使用自监督学习和粗细转换
DOI:
--
发表时间:
2023
期刊:
影响因子:
--
作者:
[田中琉聖, 山田淳司, 高木信二 , 橋本佳, 南角吉彦, 徳田恵一]
通讯作者:
徳田恵一
微分可能なメルケプストラム合成フィルタを組み込んだend-to-end 音声合成システムの検討
结合可微分梅尔倒谱合成滤波器的端到端语音合成系统的研究
DOI:
--
发表时间:
2022
期刊:
影响因子:
--
作者:
[吉村建慶, 高木信二, 中村和寛, 大浦圭一郎, 法野行哉, 橋本佳, 南角吉彦, 徳田恵一]
通讯作者:
徳田恵一
発声タイミングのずれを考慮したフレーム駆動型アテンション機構に基づく歌声合成
基于帧驱动注意机制的歌声合成,考虑到声音时序变化
DOI:
--
发表时间:
2023
期刊:
影响因子:
--
作者:
[西原美玖, 法野行哉, 橋本佳, 南角吉彦, 徳田恵一]
通讯作者:
徳田恵一
共 12 条
深層学習に基づいた新世代音声・オーディオ信号生成に関する研究
-
批准号:23K24870
-
项目类别:Grant-in-Aid for Scientific Research (B)
-
资助金额:$3.33万
-
财政年份:2024
-
负责人:徳田 恵一
-
依托单位:
t分布仮定に基づくロバストスペクトル推定
-
批准号:97F00343
-
项目类别:Grant-in-Aid for JSPS Fellows
-
资助金额:$0.77万
-
财政年份:1998
-
负责人:徳田 恵一
-
依托单位:
マルチモーダル音声認識・合成によるインターフェースの構築
-
批准号:10780226
-
项目类别:Grant-in-Aid for Encouragement of Young Scientists (A)
-
资助金额:$1.47万
-
财政年份:1998
-
负责人:徳田 恵一
-
依托单位:
隠れマルコフモデルを用いた認識ボコーダー極低ビットレート音声符号化-
-
批准号:08780333
-
项目类别:Grant-in-Aid for Encouragement of Young Scientists (A)
-
资助金额:$0.64万
-
财政年份:1996
-
负责人:徳田 恵一
-
依托单位:
隠れマルコフモデルを用いた音声の規則合成-喜怒哀楽の表現を目指して-
-
批准号:07858043
-
项目类别:Grant-in-Aid for Encouragement of Young Scientists (A)
-
资助金额:$0.58万
-
财政年份:1995
-
负责人:徳田 恵一
-
依托单位:
音声データ圧縮・蓄積システムの高品質・低ビットレート化に関する研究
-
批准号:06750373
-
项目类别:Grant-in-Aid for Encouragement of Young Scientists (A)
-
资助金额:$0.58万
-
财政年份:1994
-
负责人:徳田 恵一
-
依托单位:
適応メルケプストラム分析法に基づく音声の高能率符号化法に関する研究
-
批准号:04750270
-
项目类别:Grant-in-Aid for Encouragement of Young Scientists (A)
-
资助金额:$0.51万
-
财政年份:1992
-
负责人:徳田 恵一
-
依托单位:
海外基金