A DNN-HMM-DNN Hybrid Model for Discovering Word-Like Units from Spoken Captions and Image Regions

A DNN-HMM-DNN Hybrid Model for Discovering Word-Like Units from Spoken Captions and Image Regions
复制标题

用于从语音字幕和图像区域中发现类词单元的 DNN-HMM-DNN 混合模型

DOI:
10.21437/interspeech.2020-1148
复制
发表时间:
2020
期刊:
Interspeech
影响因子:
--
通讯作者:
Hasegawa-Johnson, Mark
Hasegawa-Johnson, Mark
中科院分区:
--
文献类型:
--
作者:
Wang, Liming;Hasegawa-Johnson, Mark

文献摘要

参考文献

被引文献

相似文献

通过人机交互界面结合语音、视觉和行为信息来获取语言
DOI: --
发表时间: 2003
影响因子: 8.1
作者:
N. Iwahashi
通讯作者: N. Iwahashi
DOI: 10.1109/taslp.2016.2517567
发表时间: 2016-03
期刊: IEEE/ACM Transactions on Audio, Speech, and Language Processing
影响因子: --
作者:
H. Kamper;A. Jansen;S. Goldwater
通讯作者: H. Kamper;A. Jansen;S. Goldwater
SPEECH-COCO:与 MSCOCO 数据集对齐的 600k 视觉基础语音字幕
DOI: --
发表时间: 2017
期刊: Interspeech
影响因子: --
作者:
William N. Havard;L. Besacier;O. Rosec
通讯作者: O. Rosec
走向基于视觉的子词语音单元发现
DOI: --
发表时间: 2019
期刊: IEEE International Conference on Acoustics, Speech, and Signal Processing
影响因子: --
作者:
David F. Harwath;James R. Glass
通讯作者: James R. Glass
多模态感官输入的单词学习计算模型
DOI: --
发表时间: 2000
期刊:
影响因子: --
作者:
D. Roy
通讯作者: D. Roy