语音生成的计算建模及在言语障碍康复中的应用
批准号:
61135003
项目类别:
重点项目
资助金额:
280.0 万元
负责人:
王岚
依托单位:
学科分类:
系统工程理论与技术
结题年份:
2016
批准年份:
2011
项目状态:
已结题
项目参与者:
彭刚、陈辉、王士元、罗德安、程宁、李胜、杨雪松、李娜、李娜、陈蒙
中文摘要
本项目从学习、发展与障碍三个层面对汉语认知加工过程及其脑机制进行研究。通过利用核磁共振设备、脑电设备探讨汉语语言信息加工的过程及其脑机制,考察中国言语障碍者汉语的获得过程,揭示大脑的汉语言功能及障碍奥秘。致力于提高汉语学习水平,同时为预防、诊断和矫治各种语言障碍提供科学依据,促进语言康复。同时,利用三维电磁发音运动跟踪设备记录发音器官运动位置,利用语音识别、虚拟现实和计算机图形技术实现一个3D虚拟头像来模拟中文普通话的发音动作,不仅包括面部动作,唇型等,还可以通过透视图观察舌部的发音模式和位置,真实地反映发音的动态效果。本研究是基于人类认知和感知虚拟现实,实现了特教老师也无法演示的发音外部和内部的效果。在此基础上,进一步观察言语障碍者通过言语康复训练后,其脑机制在语言信息的感知和加工方面的不同,从而深入了解和探索言语障碍者的康复过程,并对其进行指导。
英文摘要
本项目从学习、发展与障碍三个层面对汉语认知加工过程及其脑机制进行研究,揭示大脑的汉语言功能及障碍奥秘。特别针对汉语语音生成的生理机制展开研究,采集分析发音生理数据并进行计算建模。在此基础上探索人类对语音的视听融合感知机理和大脑的模仿机制,利用三维说话人头像模型模拟发音器官和气流运动模式,设计视听觉结合的发音训练方法和系统,深入了解言语障碍者的脑机制在语言信息的感知和加工方面的不同。本项目致力于促进汉语语言学习和言语障碍者的功能重塑,同时为预防、诊断和矫治言语障碍提供科学依据。.本项目在汉语脑认知、语音生成计算建模、语音可视化和言语功能重塑等跨学科研究领域产生一系列成果,共发表论文70篇,其中SCI/SSCI检索论文20篇,EI检索43篇,联合撰写专著1本,专著章节1本,申请中国发明专利14项,授权发明专利5项。在语音生成和理解的脑机制方向的研究论文先后发表在 PNAS, NeuroImage , Human Brain Mapping 等高影响因子的国际期刊上;所提出的语音生成计算建模方法发表在语音领域 IEEE trans. On ASLP, Speech Communication 等旗舰杂志上;在三维虚拟现实和可视化方面提出的算法发表在 ACM TOG , CVPR 等较高影响力的杂志和国际会议上。一篇研究论文获得ICIA & ICAL 2013 最佳学生论文奖。本项目首次提出并实现了汉语三维发音和气流运动模拟,并率先将虚拟说话人三维虚拟说话人发音模拟用于听障儿童和自闭症儿童的构音训练中,通过行为实验和眼动实验的临床测试发现:利用3D虚拟说话人进行发音学习相对于真人教师的学习提高程度更大。所研发的“可视化言语康复训练系统”已经被民政部下属的陕西省残疾人辅具中心,深圳市早期干预中心等单位列为推荐产品,并且在十余家三甲医院康复科、言语康复中心、聋校推广使用,对各类听障、自闭症、脑卒中失语症、帕金森症患者进行康复训练2000余人次。.2013年在深圳市发改委支持下建立了华南地区首个“言语治疗和康复技术工程实验室”,并于2015年举行召开首届“言语治疗和康复技术研讨会”。项目负责人担任ISCSLP 2012, 2016 等国际会议组委会成员,举办国际会议1次,并多次在语音、脑认知等领域的国际会议上报告研究成果。共培养硕士生24名,博士生5名。
期刊论文列表
专著列表
科研奖励列表
会议论文列表
专利列表
登录
查看更多内容
DOI:
--
发表时间:
2014
期刊:
软件学报
影响因子:
--
作者:
[张镇嵩, 陈辉, 戴国忠, 王宏安]
通讯作者:
王宏安
Normalization of lexical tones and nonlinguistic pitch contours: Implications for speech-specific processing mechanism
词汇声调和非语言音调轮廓的标准化:对语音特定处理机制的影响
DOI:
10.1121/1.4973414
发表时间:
2017
期刊:
The Journal of the Acoustical Society of America
影响因子:
--
作者:
[Kaile Zhang, Xiao Wang, Gang Peng]
通讯作者:
Gang Peng
Automatic Complexity Control of Generalized Variable Parameter HMMs for Noise Robust Speech Recognition
用于噪声鲁棒语音识别的广义变参数 HMM 的自动复杂度控制
DOI:
10.1109/taslp.2014.2372901
发表时间:
2015
期刊:
IEEE-ACM Transactions on Audio Speech and Language Processing
影响因子:
5.4
作者:
[Rongfeng Su, Xunying Liu, Lan Wang]
通讯作者:
Lan Wang
Context Effect in the Categorical Perception of Mandarin Tones
普通话声调分类感知中的语境效应
DOI:
10.1007/s11265-015-1008-2
发表时间:
2016-02-01
期刊:
JOURNAL OF SIGNAL PROCESSING SYSTEMS FOR SIGNAL IMAGE AND VIDEO TECHNOLOGY
影响因子:
1.8
作者:
[Chen, Fei, Peng, Gang]
通讯作者:
Peng, Gang
Cross-language differences in the brain network subserving intelligible speech
大脑网络中的跨语言差异有助于可理解的言语
DOI:
10.1073/pnas.1416000112
发表时间:
2015-03-10
期刊:
PROCEEDINGS OF THE NATIONAL ACADEMY OF SCIENCES OF THE UNITED STATES OF AMERICA
影响因子:
11.1
作者:
[Ge, Jianqiao, Peng, Gang, Gao, Jia-Hong]
通讯作者:
Gao, Jia-Hong
共 26 条
复杂环境下语音数据的目标识别与内容转写
-
批准号:U1736202
-
项目类别:联合基金项目
-
资助金额:251.0万元
-
批准年份:2017
-
负责人:王岚
-
依托单位:
复杂声学环境下的说话人语音信息的抽取、分离和识别
-
批准号:90920002
-
项目类别:重大研究计划
-
资助金额:50.0万元
-
批准年份:2009
-
负责人:王岚
-
依托单位:
发音错误自动检测方法的研究及其在语言学习中的应用
-
批准号:60772165
-
项目类别:面上项目
-
资助金额:25.0万元
-
批准年份:2007
-
负责人:王岚
-
依托单位:
国内基金
海外基金