面向阅读理解的问题自动生成关键技术研究
批准号:
62076008
项目类别:
面上项目
资助金额:
58.0 万元
负责人:
吴云芳
依托单位:
学科分类:
自然语言处理
结题年份:
2024
批准年份:
2020
项目状态:
已结题
项目参与者:
吴云芳
中文摘要
问题生成近年来引起了研究者广泛的兴趣,其研究成果可以节约教育者的时间和精力、提升智能问答和人机对话等应用系统的性能。本项目面向教育领域的阅读理解,研究段落级无答案问题生成,即给定一个段落文本而无答案信息,研究如何自动生成语义相关、语法通顺的高质量问题。围绕问题生成,将着力探索以下关键技术难题:1) 基于自动文摘、机器阅读理解等数据,利用多任务学习方法来自动识别文本中值得提问的关键句;2) 融入篇章结构信息进行长文档的表示学习,显性编码句子位置索引,在图神经网络模型中引入篇章结构关系和指代信息,以期生成具有一定跨句推理能力的问题;3)提出了一个新颖的多任务学习框架,将复述生成作为子任务来辅助问题生成,以期生成具有多样化表达的问题;4) 提出将常识融入问题生成的网络模型,采用门控注意力机制在编码中融入常识并且利用双重拷贝机制使模型得以拷贝常识中的词项,以期生成具有一定常识推理能力的问题。
英文摘要
In recent years, question generation (QG) attracts wide attention from the NLP researchers, due to the fact that it can save educational experts’ time and labor, and it can boost the performance of question answering and dialog generation systems. This project will make a research on answer-agnostic paragraph-level question generation oriented towards reading comprehension in the educational field. Given a passage but without answer, the system aims to automatically generate high-quality questions that are fluent and semantically related with the passage. We will make an in-depth study on the following key technologies for QG. 1) Based on different datasets available for summarization and machine reading comprehension, we propose a multitask learning method to predict the question-worthy key sentences in a passage. 2) We incorporate discourse structure information to learn the passage representations to generate questions with multi-sentence reasoning, adding sentence position index, and integrating the discourse information and the coreference dependency into the graph neural network. 3) We propose a novel multitask learning framework to produce human-like questions with diverse expressions, by employing paraphrase generation as an auxiliary task to help QG. 4) We propose a novel model to leverage commonsense knowledge for QG to generate human-like questions that can do commonsense reasoning, using a gated attention mechanism to fuse commonsense into the passage encoding, and using a dual copy mechanism to allow the model to copy words from commonsense tuples.
问题生成是自然语言处理的一个重要基础任务,其研究成果可以节约教育者的时间和精力、提升智能问答和人机对话等应用系统的性能。本项目面向教育领域的阅读理解,研究了基于预训练模型的问题生成关键技术,主要包括:1)面向阅读考试的问题生成,构建了答句驱动的段落级语义图来捕捉篇章结构信息;2)无给定答案情形下,基于预训模型提出了一个问题生成框架,自动生成关键短语进而自动生成问题-答案句对;3)提出了一个多任务学习框架将常识知识融入问题生成过程,将问题生成作为主任务,常识关系预测和尾实体生成作为辅助任务;4)提出了答案局部建模和句法掩码注意机制,将文本结构信息有机融入到预训模型中来生成更高质量的问题;5)提出了一种新颖的基于混合专家模型的干扰项生成框架,并对模型结构和路由策略进行了修改,以同时提高生成质量和多样性;6)提出了基于大语言模型知识蒸馏的无监督干扰项生成方法,利用大模型生成伪数据标签,将答案生成任务和干扰项生成任务一起应用到下游模型的蒸馏过程之中,构造对偶生成任务。此外,项目还对分级阅读、文法纠错、大模型上下文学习等相关问题进行了探讨:1)提出了特征投射与长度平衡损失的难度测评神经网络模型;2)提出了错误驱动的汉语拼写改错模型;3)首次将句法信息应用于上下文学习的样例选择中,来提升大模型在语法纠错、机器翻译的少样本推理性能。围绕项目研究,共发表相关论文20篇,其中国际计算语言学、人工智能顶尖会议(CCF-A/B) 有14篇。申请发明专利1项。
基于文档的智能问答的关键技术研究与资源建设
-
批准号:61773026
-
项目类别:面上项目
-
资助金额:60.0万元
-
批准年份:2017
-
负责人:吴云芳
-
依托单位:
基于汉语话题的句际关系自动分析研究
-
批准号:61371129
-
项目类别:面上项目
-
资助金额:80.0万元
-
批准年份:2013
-
负责人:吴云芳
-
依托单位:
基于词语独异性特征的大规模词义标注语料库自动构建研究
-
批准号:60703063
-
项目类别:青年科学基金项目
-
资助金额:20.0万元
-
批准年份:2007
-
负责人:吴云芳
-
依托单位:
国内基金
海外基金