Integration of speech and vision using mutual information
Integration of speech and vision using mutual information
复制标题
使用互信息整合语音和视觉
DOI:
--
复制
发表时间:
2000
期刊:
影响因子:
--
通讯作者:
D. Roy
中科院分区:
文献类型:
--
作者:
D. Roy
We are developing a system which learns words from co-occurring spoken and visual input. The goal is to automatically segment continuous speech at word boundaries without a lexicon, and to form visual categories which correspond to spoken words. Mutual information is used to integrate acoustic and visual distance metrics in order to extract an audio-visual lexicon from raw input. We report results of experiments with a corpus of infant-directed speech and images.