自然语言处理深度模型的对抗攻防关键算法研究
批准号:
62076105
项目类别:
面上项目
资助金额:
59.0 万元
负责人:
何琨
依托单位:
学科分类:
机器学习
结题年份:
2024
批准年份:
2020
项目状态:
已结题
项目参与者:
何琨
中文摘要
自然语言处理基于深度学习技术迎来了新的突破,但其模型的鲁棒性问题也逐渐引起了国内外学者的关注。文本对抗样本是指对文本做精心设计的扰动,不影响人类阅读却能使模型产生错误输出的一类样本。该方向近两年刚刚兴起,尚有不少空白。由于文本的离散性质,无法直接借鉴图像对抗攻防这一较为成熟领域的方法。本项目拟从深度学习对抗性攻击的生成机理、对抗攻击与防御和攻防实证几个层面展开对自然语言处理深度模型的对抗攻防基础理论和关键算法的研究,基于强化学习、遗传算法、快速梯度投影、句法结构转换等方法设计高效、快速的对抗攻击方法,基于对抗训练、梯度投影惩罚等方法设计可有效抵御现有攻击且具有一定能力抵御未知攻击的、高可靠性深度模型系统,并将这些基础理论与关键技术用于文本分类、机器翻译等场景的对抗攻防实证研究。本项目具有一定的前瞻性且有重要的应用需求,将为相关核心应用提供理论和技术支撑,产生聚焦国际前沿的原创性研究成果。
英文摘要
Natural Language Processing (NLP) has made great progress with the rapid development of deep learning techniques, and the robustness of deep NLP models has attracted more attention recently. A text adversarial example is a text generated by adding well-designed perturbation to the original text that does not influence human reading but leads to wrong output. This is a new research direction started in recent two years, and there are many problems to be explored. Due to the discrete property of text, techniques developed for image adversarial attack or defense are hard to be implemented for NLP.. In this project, we will focus on the basic theory and key algorithms for defense and attack on various NLP deep learning models, including the intrinsic reason, adversarial attack and defense methods and applications. We will design highly effective adversarial attack methods based on reinforce learning, genetic algorithm, fast gradient projection method, syntactic structure transformation. Also, based on adversarial training and gradient projection penalty, we will design novel methods to effectively resist existing attacks, and wish the designed models have a high reliability to future possible attacks. The developed theories and methods will be applied to the sceneries of text classification and machine translation. This is a forward-looking project that has important applications. It will provide theoretical as well as technical support for robust deep learning applications, and it is expected to yield world class, fundamental results.
自2019年以来,研究表明自然语言处理模型同样面临对抗样本的问题。本项目主要研究文本分类任务和神经机器翻译任务中的对抗攻击与防御,设计并提出了一系列有效的对抗攻击与防御策略,已在NeurIPS、ACL、CVPR、ICCV、AAAI、IJCV、UAI、EMNLP、NAACL等学术会议或期刊上发表了21篇相关论文(其中CCF A类8篇、CCF B类7篇) ,申请发明专利1项,参与了2项国际相关标准和制定。在文本分类任务方面,提出了文本对抗样本的概念,并提出了首个黑盒对抗攻击方法PWWS,该方法在ACL 2019 Oral上发表,谷歌学术引用量达到791次,产生了广泛的行业影响。随后,提出了首个针对神经机器翻译任务的黑盒对抗攻击方法,取得了源头创新。进一步地,本项目还提出了多个文本对抗攻击和防御的方法。其中,基于同义词编码的防御方法(UAI 2021)、快速梯度投影对抗攻击方法(AAAI 2021)以及针对神经机器翻译的攻击方法(ACL 2021 Oral)分别获得了168次、80次和52次的谷歌学术引用量;关于迁移对抗黑盒攻击的3篇代表性论文,学术引用量分别为462次、252次和90次。由于在对抗机器学习方面的工作,项目负责人受邀做了8场深度模型对抗攻防的全国性学术报告。本项目为自然语言处理模型的安全性提供了坚实的理论基础,推动了深度学习在可信安全领域的应用与发展,在国内外学术界产生了较大的学术影响力。.在项目执行期间,共培养毕业博士研究生7名,培养毕业硕士研究生34名,培养毕业本科生约27名,所培养的本科生中有1名入选华为天才少年,所培养的研究生中有2名入选华为天才少年、1名入选移动金种子计划、10名获得国家奖学金、4名获得腾讯犀牛鸟精英人才计划支持,1名博士生的论文入选2024 CCF理论计算机科学博士学位论文激励计划提名名单。
电磁空间智能识别算法的对抗攻击技术
-
批准号:U22B2017
-
项目类别:联合基金项目
-
资助金额:253.00万元
-
批准年份:2022
-
负责人:何琨
-
依托单位:
大型网络中基于局部谱的社团检测算法研究
-
批准号:61772219
-
项目类别:面上项目
-
资助金额:16.0万元
-
批准年份:2017
-
负责人:何琨
-
依托单位:
基于糅合策略的超大规模集成电路布图规划问题的算法研究
-
批准号:61472147
-
项目类别:面上项目
-
资助金额:84.0万元
-
批准年份:2014
-
负责人:何琨
-
依托单位:
四维时空高效利用的装箱调度问题
-
批准号:61173180
-
项目类别:面上项目
-
资助金额:52.0万元
-
批准年份:2011
-
负责人:何琨
-
依托单位:
国内基金
海外基金