Development of end-to-end speech recognition techniques for super-elderly that can deal with the cause of recognition errors
Development of end-to-end speech recognition techniques for super-elderly that can deal with the cause of recognition errors
批准号:
22K12084
负责人:
山本 一公
金额:
$2.66万
依托单位:
依托单位国家:
日本
项目类别:
Grant-in-Aid for Scientific Research (C)
财政年份:
2022
资助国家:
日本
项目状态:
未结题
起止时间:
2022-04-01 至 2025-03-31
中文摘要
点击翻译按钮获取中文摘要
英文摘要
音声認識技術が広く一般に普及してきたが,見守りロボットの対象となっている超高齢者に対しては認識精度が非常に悪く,精度改善が課題となっている。最近の高精度音声認識技術は,入力特徴に対してニューラルネットワーク(NN) で直接認識結果文字列を生成する「End-to-End(E2E)音声認識」方式が主流となってきているが,E2E音声認識で用いられるNNは非常に巨大で,大量の学習用音声データが必要となる。しかし,大量の超高齢者音声を収集することは非常に困難であり,従来法のように少量データから推定した超高齢者音声の特徴を直接モデルに反映できる手法が望まれるが,E2E音声認識手法はそのような変更が容易でない。そこで,E2E音声認識におけるNNの入力層付近(特徴抽出)と出力層付近(出力ラベル)を分けることで,従来の音声認識研究の知見を包含したE2E音声認識技術を開発することが本研究の目的である。2022年度の研究では,研究代表者である山本がNNの入力層付近での誤り説明可能化に関する研究を,研究分担者である西崎が出力層付近での誤り説明可能化に関する研究を行った。山本は超高齢者の少量の学習データにより安定的に話者適応化することで,超高齢者音声認識性能を向上させる研究を行った。これまでは入力層であるガンマトーンフィルタバンクのパラメータだけで話者適応化を行っていたが,入力層だけでなく,周辺のパラメータを同時に話者適応化することで,学習データが少量の場合でも安定的に話者適応化が行えるようになった。西崎は,日本語wav2vec 2.0をベースに音素(単位)モデルを訓練する際に,異なる音素同士をより識別するための距離学習を導入する方法を開発した。複数言語音声でモデルを検証したところ,高い音素識別性能を持つモデルが訓練できることが分かった。
期刊论文(0)
专著(0)
科研奖励(0)
会议论文
話し言葉音声認識のための発話速度変動に頑健な音響モデルの開発
-
批准号:16700171
-
项目类别:Grant-in-Aid for Young Scientists (B)
-
资助金额:$2.18万
-
财政年份:2004
-
负责人:山本 一公
-
依托单位:
音声認識のための動的特徴を効果的に用いる隠れマルコフモデルに関する研究
-
批准号:13780274
-
项目类别:Grant-in-Aid for Young Scientists (B)
-
资助金额:$1.47万
-
财政年份:2001
-
负责人:山本 一公
-
依托单位:
海外基金