多聚焦视频的融合与编码研究
批准号:
62071014
项目类别:
面上项目
资助金额:
55.0 万元
负责人:
孙俊
依托单位:
学科分类:
多媒体通信
结题年份:
2024
批准年份:
2020
项目状态:
已结题
项目参与者:
孙俊
中文摘要
多聚焦视频作为一种可以有效克服光学成像系统景深有限性的媒体方式,正逐渐受到研究者的关注。然而,当前多聚焦视频的融合效果还不够理想,融合与编码过程也冗余复杂,没有有效利用多聚焦视频的原始码流信息,给多聚焦视频的应用普及带来了巨大的挑战。本项目将致力于多聚焦视频的融合与编码研究,以提升融合的质量与速度、编码的效率为目的,主要研究内容包括:针对现阶段还没有公开的具有标注信息的多聚焦视频数据集问题,研究合成数据集方式来构建大规模具有标注信息的训练数据集;利用深度神经网络良好的特征表征能力,构建适用于多聚焦视频融合的网络模型,并进一步研究如何优化融合过程。在融合层基础上,以利用多聚焦视频原始码流信息为基本思路,开展对融合视频的高效编码研究,为多聚焦视频应用奠定基础。最后,从定性估计及定量计算两个角度,研究如何评价融合质量,建立可靠的多聚焦融合视频质量评价方法,进一步指导融合及编码算法的性能提升。
英文摘要
Multi-focus video, as a media method that can effectively overcome the limited depth of field of the optical imaging system, is gradually attracting researchers' attention. However, the current fusion effect of multi-focus video is still not ideal, and the fusion and coding process is redundant and complex since the original bitstream information of multi-focus video is not effectively utilized, which bring great challenges to the application of multi-focus video. In this project, we focus on the fusion and coding of multi-focus video, with the aim of improving the quality and speed of fusion, and the efficiency of coding. First, since there are no public multi-focus video datasets with annotation information yet, we propose a synthesis method to build a large-scale training dataset with labeled information. By leveraging the well feature representation capabilities of deep neural networks, we establish a fusion model tailored to multi-focus video and further optimize the fusion process. On the basis of the fusion level, by exploiting the original bitstream information of multi-focus video, we try to achieve high-efficient coding of fusion video, laying the foundation for multi-focus video applications. Finally, from two perspectives of qualitative estimation and quantitative calculation, we establish a reliable multi-focus fusion video quality evaluation method, and further guide the performance improvement of fusion and coding algorithms.
本项目围绕多聚焦视频融合与编码问题进行系统性研究,取得了显著科研成果,期间共发表高质量期刊和会议论文15篇(包括3篇已录用会议论文),其中4篇发表于TIP、TCSVT、TOMM等国际顶级期刊。研究成果主要体现在三个方面:多聚焦视频融合框架构建、融合结果高效编码、融合质量评价体系建立。. 在多聚焦视频融合框架的构建方面,项目提出了一个结合时空卷积层的新型多聚焦视频融合框架。该框架能够有效融合不同焦点区域的图像细节,减少融合过程中的伪影,并保持图像的锐度和清晰度,时空卷积设计能够同时处理视频帧间的时间关联性和每帧的空间特征,通过引入多尺度时序融合技术,我们能够在多个时间尺度上融合视频帧的特征,从而捕捉视频的动态变化和细节信息。. 在融合结果的高效编码方面,项目提出一个结合软目标学习和约束感知机制的神经网络,用于高效优化帧内编码过程,通过动态选择最佳编码模式,提高编码精度并减少计算复杂度。项目还提出了基于广义高斯分布的码率估计方法,引入统计模型进行码率估计,优化量化水平的选择。这些方法减少了编码中的计算负担,提高了编码效率,为实时视频编码提供了新的解决方案。. 在融合质量评价方面,通过对视频帧在不同时间尺度上进行特征融合,并引入分层质量评分机制,我们有效恢复了压缩视频中的细节信息,在减少压缩过程中的失真的同时,最大化恢复细节,提升最终的视频质量。项目结合知识追踪技术,通过持续追踪、学习和更新系统对视频内容的理解,在不断变化的视频内容和融合过程中提供更具上下文感知能力的质量评价。. 本项目的研究成果已成功应用于多个实际场景,如视频监控系统中的视频清晰度提升和细节呈现,视频编码与传输系统中的数据传输效率提升,特别是在低带宽环境下,展现了较大的技术优势。项目还与天津联通、中国铁塔等公司合作,推动了多聚焦视频相关技术在视频监控、视频传输等领域的应用,产生了良好的经济效益。
立体视频的高效编码研究
-
批准号:61671025
-
项目类别:面上项目
-
资助金额:60.0万元
-
批准年份:2016
-
负责人:孙俊
-
依托单位:
高效可伸缩视频的编码、分析和调度研究
-
批准号:61271020
-
项目类别:面上项目
-
资助金额:80.0万元
-
批准年份:2012
-
负责人:孙俊
-
依托单位:
面向3G的可伸缩视频编码、分析和调度研究
-
批准号:60902004
-
项目类别:青年科学基金项目
-
资助金额:22.0万元
-
批准年份:2009
-
负责人:孙俊
-
依托单位:
国内基金
海外基金