基于张量深度学习和注意力机制的无参考声音质量评价方法研究
批准号:
62071039
项目类别:
面上项目
资助金额:
63.0 万元
负责人:
王晶
依托单位:
学科分类:
多媒体信息处理
结题年份:
2024
批准年份:
2020
项目状态:
已结题
项目参与者:
王晶
中文摘要
无参考声音质量评价提供了一种非插入式的衡量用户听音体验的客观化技术手段,是语音传输和音频回放系统性能的重要评估指标。未来以IP为基础的高清语音以及沉浸式的空间音频成为语音和音频系统的主流,如何有效评价无法获取参考音源情况下的输出声音质量成为行业急需但不容易解决的问题。本研究将以准确反映用户主观听觉体验为最终目标,致力于从人因维度出发对大规模声音数据的损伤特征进行高阶空间上的深度感知和融合,利用张量深度学习和注意力机制对受损声音信号的听觉体验机理进行建模,建立从感知到认知的两级学习模型并进行联合优化,进一步引入迁移学习将无参考语音质量评价扩展到空间音频质量评价。本项目从提高语音和音频系统用户听觉体验满意度的实际需求出发,引入新的技术手段解决无参考声音质量客观评价这一具有挑战性的问题,为语音和音频评价技术领域提供新的建模方法和研究思路,具有重要的理论和应用意义。
英文摘要
The non-reference sound quality evaluation provides a non-intrusive objective technical measure of the user's listening experience, and is an important evaluation index for the performance of speech transmission and audio playback systems. In the future, IP-based high-definition voice and immersive spatial audio will become the mainstream of voice and audio systems. How to effectively evaluate the output sound quality in the case where a reference sound source cannot be obtained has become a problem that is urgently needed but not easily solved in the industry. In this research, the ultimate goal is to accurately reflect the user's subjective auditory experience. It is committed to the depth perception and fusion of the damage characteristics of large-scale sound data in high-order space from the human factor dimension. The auditory experience mechanism of the impaired sound signal is modeled by use of tensor deep learning and attention mechanism, a two-level learning model from perception to cognition is established for joint optimization, and transfer learning is further introduced to extend the evaluation of non-reference speech quality to the evaluation of spatial audio quality. This project introduces new technical methods to solve the challenging problem of non-reference sound quality objective evaluation from the actual needs of Improving user hearing experience satisfaction with speech and audio systems. Our research will provide new modeling methods and research ideas for the technical field of speech and audio evaluation, which has important theoretical and application significance.
本项目聚焦于研究基于张量深度学习与注意力机制的无参考声音质量评价方法,旨在为高清语音通信和空间音频系统提供一种新颖的非插入式客观评估手段,以精准衡量用户听音体验,满足日益增长的性能评估需求。项目构建了涵盖主观测试与仿真数据的多个语音质量评价数据库,为深入研究理论模型奠定坚实基础;针对在线会议场景从人因维度出发提出了创新的语音质量评估神经网络模型,通过优化损失函数显著提升了评估准确性;同时,将i-vector说话人特征融入合成音频评价,成功构建了i-MOSNet和i-MBNet模型,其性能超越原始基线模型。项目基于张量深度学习深入研究了语音增强降噪、声音事件检测及无参考质量评价算法,利用高阶张量学习能力有效提升了语音处理技术的整体性能;进一步结合注意力机制,提出一种优于现有标准的无参考声音质量评价算法,并设计了端到端双通道音乐分离算法,进一步增强算法性能。本项目基于感知与认知两级模型,在探索数据仿真、对抗训练等方法的基础上,成功构建了一种针对语音通信系统的端到端无参考质量评估模型,实现了评估精度的显著提升。此外,项目还拓展了空间音频评价研究,提出了一系列无参考主观与客观评价方法,为智能座舱、XR等应用场景提供了有价值的参考。本项目共计发表30篇论文(其中SCI索引10篇,EI索引15篇),出版编著1部,申请国内发明专利2项,颁布电子行业标准与国家标准各1项,并立项国际标准1项;同时,培养了4名博士生和9名硕士研究生,并开展国际学术交流8人次。这些研究成果对无参考声音质量评价技术的发展具有深远影响,为高清语音通信和空间音频系统的质量评估提供了坚实的理论基础和方法支撑,显著提升了相关领域的技术水平,展现出广阔的应用前景。
基于张量分析的空间音频信号压缩与重建技术研究
-
批准号:61571044
-
项目类别:面上项目
-
资助金额:60.0万元
-
批准年份:2015
-
负责人:王晶
-
依托单位:
基于多因素特征子空间分解机理的多语言语音分析与综合方法研究
-
批准号:61001188
-
项目类别:青年科学基金项目
-
资助金额:20.0万元
-
批准年份:2010
-
负责人:王晶
-
依托单位:
国内基金
海外基金