深層ベイズ学習に基づく歌声の認識と生成の統一理論
深層ベイズ学習に基づく歌声の認識と生成の統一理論
批准号:
19J15255
负责人:
錦見 亮
金额:
$1.34万
依托单位:
依托单位国家:
日本
项目类别:
Grant-in-Aid for JSPS Fellows
财政年份:
2019
资助国家:
日本
项目状态:
已结题
起止时间:
2019-04-25 至 2021-03-31
中文摘要
本研究では,音楽音響信号から歌声が担う主旋律の楽譜を推定する歌声採譜技術を扱う.主旋律は多くの楽曲の印象に密接に関連しているため,歌声採譜は認識・生成の双方向歌声解析において重要な技術である.歌声の音高軌跡(F0軌跡)はビブラートやオーバシュート等の歌唱表現よって,楽譜に記述された音符の音高や発音時刻から大きく逸脱しているため,単純な方法では音楽的に不自然な音符列が推定されてしまう.また,従来法は事前推定したF0軌跡を時間・周波数方向に離散化して楽譜を推定しているが,事前推定による誤差伝播の問題や音符のオンセット情報が欠落したF0軌跡からは同音高の連続音符の境界が判定不能という問題があるため,音楽音響信号を直接扱える手法の構築が必要であった.そこで本研究では,深層ニューラルネットワークに基づく音響モデルと従来の統計モデルに基づく言語モデルを統合した音楽音響信号の生成モデルを開発した.提案モデルにおいて,言語モデルはセミマルコフモデル(semi-Markov model; SMM)で構成され,調に依存しながら音符系列が生成される過程を表現する.また,音響モデルは畳み込みリカレントニューラルネットワーク(convolutional recurrent neural network; CRNN)で構成され,音符に基づいて観測音楽音響信号が生成される過程を表現する.提案モデルは,言語モデルに基づく音符に関する文法的な知識とCRNN音響モデルの表現力の両方を活用しながら,ビタビアルゴリズムを用いて音楽信号から直接音符を推定する.実際の音楽音響信号と合成の歌声を用いた評価実験では,従来の歌声F0軌跡に対する歌声採譜手法よりも高い性能を達成した.また,音響モデルのみ用いて推定された楽譜よりも高い性能を達成したことから,言語モデルと音響モデルを統合することの有効性も確認した.
英文摘要
本研究では,音楽音響信号から歌声が担う主旋律の楽譜を推定する歌声採譜技術を扱う.主旋律は多くの楽曲の印象に密接に関連しているため,歌声採譜は認識・生成の双方向歌声解析において重要な技術である.歌声の音高軌跡(F0軌跡)はビブラートやオーバシュート等の歌唱表現よって,楽譜に記述された音符の音高や発音時刻から大きく逸脱しているため,単純な方法では音楽的に不自然な音符列が推定されてしまう.また,従来法は事前推定したF0軌跡を時間・周波数方向に離散化して楽譜を推定しているが,事前推定による誤差伝播の問題や音符のオンセット情報が欠落したF0軌跡からは同音高の連続音符の境界が判定不能という問題があるため,音楽音響信号を直接扱える手法の構築が必要であった.そこで本研究では,深層ニューラルネットワークに基づく音響モデルと従来の統計モデルに基づく言語モデルを統合した音楽音響信号の生成モデルを開発した.提案モデルにおいて,言語モデルはセミマルコフモデル(semi-Markov model; SMM)で構成され,調に依存しながら音符系列が生成される過程を表現する.また,音響モデルは畳み込みリカレントニューラルネットワーク(convolutional recurrent neural network; CRNN)で構成され,音符に基づいて観測音楽音響信号が生成される過程を表現する.提案モデルは,言語モデルに基づく音符に関する文法的な知識とCRNN音響モデルの表現力の両方を活用しながら,ビタビアルゴリズムを用いて音楽信号から直接音符を推定する.実際の音楽音響信号と合成の歌声を用いた評価実験では,従来の歌声F0軌跡に対する歌声採譜手法よりも高い性能を達成した.また,音響モデルのみ用いて推定された楽譜よりも高い性能を達成したことから,言語モデルと音響モデルを統合することの有効性も確認した.
期刊论文(28)
专著(0)
科研奖励(0)
会议论文
登录
查看更多内容
LSTM-HSMMハイブリッドモデルに基づく音楽構造解析
基于LSTM-HSMM混合模型的音乐结构分析
DOI:
--
发表时间:
2020
期刊:
影响因子:
--
作者:
[柴田 剛, 錦見 亮, 中村 栄太, 吉井 和佳]
通讯作者:
吉井 和佳
DOI:
10.1017/atsip.2021.4
发表时间:
2021-04
期刊:
APSIPA Transactions on Signal and Information Processing
影响因子:
3.2
作者:
[Ryo Nishikimi;Eita Nakamura;Masataka Goto;Kazuyoshi Yoshii]
通讯作者:
Ryo Nishikimi;Eita Nakamura;Masataka Goto;Kazuyoshi Yoshii
ピアノ採譜のための深層学習に基づく音価と声部の同時推定
基于深度学习的钢琴转录音值和声部同步估计
DOI:
--
发表时间:
2021
期刊:
影响因子:
--
作者:
[平松 祐紀, 柴田 剛, 錦見 亮, 中村 栄太, 吉井 和佳]
通讯作者:
吉井 和佳
拍節構造の周期性に基づく深層ビート推定
基于韵律结构周期性的深拍估计
DOI:
--
发表时间:
2021
期刊:
影响因子:
--
作者:
[大山偉永, 石塚 崚斗, 錦見 亮, 吉井 和佳]
通讯作者:
吉井 和佳
深層クラスタリングを用いた任意楽器パートの自動採譜
使用深度聚类自动转录任意仪器部件
DOI:
--
发表时间:
2020
期刊:
影响因子:
--
作者:
[田中 啓太郎, 中塚 貴之, 錦見 亮, 吉井 和佳, 森島 繁生]
通讯作者:
森島 繁生
共 27 条
海外基金