机器学习问题的动量优化方法研究
批准号:
62076252
项目类别:
面上项目
资助金额:
59.0 万元
负责人:
陶卿
依托单位:
学科分类:
机器学习
结题年份:
2024
批准年份:
2020
项目状态:
已结题
项目参与者:
陶卿
中文摘要
无论是经典的正则化损失函数框架还是目前的研究热点深度学习,优化问题的高效求解都是一个不可或缺的关键环节。为了进一步改善梯度下降方法的性能,人们受物理学动量原理的启发开始使用动量优化方法。..动量方法的里程碑事件是使求解凸光滑问题梯度下降法的收敛速率获得了数量级式的加速。近期的研究表明动量方法可以提高深度学习的性能并指导网络的结构设计。但到目前为止,动量方法的研究仍然存在着一些欠缺,特别是非光滑问题很少涉及,不同动量方法的加速性和普适性也没有充分地体现。..本项目主要研究动量方法对一阶梯度优化算法收敛速率的加速问题和探索在深度学习和基于学习的优化中的应用。期待将动量技巧作为一种普适方法提升已有优化算法的性能,回答关于动量方法的争议,同时从动量方法角度给出Shamir在2012年COLT提出的强凸目标函数收敛性open问题另一种回答,并进一步期待动量优化方法可以克服深度学习的一些固有缺陷。
英文摘要
No matter in the classical regularized loss framework or in the state-of-the-art deep learning, it is an indispensable key part to solve the induced optimization problems efficiently. To further improve the performance of SGD, momentum-based optimization methods inspired by the physics principle have been used...The milestone about momentum methods is that it can accelerate the convergence rate of gradient descent methods by an order of magnitude when dealing with convex and smooth problems. Its recent successful application in deep learning reveals that momentum methods can remarkably improve performance of the deep neural networks and guide designation of their structures. However so far, there still exist some deficiencies. Especially, the nonsmooth optimization problems are seldom concerned and the acceleration and universality of different momentum methods are not sufficiently revealed...In this project, we mainly focus on investigating the role of momentum methods in acceleration of convergence rates of first-order gradient algorithms. Besides, their application in learning-based optimization as well as deep learning will be explored. As a result, we expect momentum technique can be used as a general method to improve the convergence performance of existing optimization algorithms, and some disputes about momentum methods can be answered. Simultaneously, we attempt to give another answer to the open problem from the perspective of momentum methods, which is about optimal convergence of the strongly-convex functions posed by Shamir in COLT2012. Furthermore, we also expect that the momentum methods can overcome some inherent defects in deep learning.
标准的动量优化算法有两种:一种是Polyak于1964年提出的HB(Heavy-Ball)方法;另一种是1983年Nesterov提出的NAG (Nesterov Accelerated Gradient)方法。随着深度学习的发展,动量优化方法又演化出多种变形。在深度学习应用中表现良好且被广泛采用的动量算法是Kingma等人在2015年提出的Adam。..目前,人们已经对机器学习中的正则化损失函数问题得到了众多形式的随机优化算法,但绝大多数只是对迭代进行平均的输出方式讨论了收敛速率,甚至无法保证最为典型的稀疏结构。与之不同的是,个体解具有很好的稀疏性,其最优收敛速率已经作为open问题被广泛探索。对于一般凸优化问题,SGD能使平均收敛速率达到最优,但个体解却无法达到最优。对于强凸优化问题,不论是采用平均输出方式还是个体输出方式,SGD都无法达到最优。..HB动量方法的加速性目前仅体现在光滑强凸等优化问题上,本项目最重要贡献之一是我们在一般凸问题上发现了HB的加速性,我们证明了Heavy-ball型动量方法的个体收敛速率能达到一般凸情形的最优,说明了Heavy-ball型动量方法可以作为一种加速策略将梯度下降法的个体收敛速率提升至最优,即我们从添加动量的角度给出了Shamir关于一般凸情形SGD收敛性open问题的另一种回答。进一步,我们将其推广至EMA形式自适应步长策略的情形,克服了Adam收敛性证明中由于采用EMA形式动量导致的不收敛问题(Reddi问题),解决了个体解作为最终输出时存在的理论分析和应用不一致问题,且所提算法在深度学习的实验中也表现良好。..在本项目的资助下,共发表论12篇。据不完全统计,所发表的论文已经被Google Scholar他引30次以上,其中包括CCF人工智能A类会议ICML、NeurIPS 和AAAI,CCF人工智能和自动化领域A类期刊Artificial Intelligence、Machine Learning、IEEE Trans on Services Computing、IEEE Trans on Automatic Control和Automatica。因此,无论是数量还是从质量和学术影响的角度来说,都圆满地完成了任务书的成果指标。
机器学习随机优化方法的个体收敛性研究
-
批准号:61673394
-
项目类别:面上项目
-
资助金额:65.0万元
-
批准年份:2016
-
负责人:陶卿
-
依托单位:
大规模机器学习问题的结构优化方法研究
-
批准号:61273296
-
项目类别:面上项目
-
资助金额:83.0万元
-
批准年份:2012
-
负责人:陶卿
-
依托单位:
基于损失函数的统计机器学习算法及其应用研究
-
批准号:60975040
-
项目类别:面上项目
-
资助金额:29.0万元
-
批准年份:2009
-
负责人:陶卿
-
依托单位:
统计学习理论与算法研究
-
批准号:60575001
-
项目类别:面上项目
-
资助金额:23.0万元
-
批准年份:2005
-
负责人:陶卿
-
依托单位:
国内基金
海外基金