课题基金 / 基金详情

低资源依存句法模型构建与可解释性分析

批准号:
62076097
项目类别:
面上项目
资助金额:
58.0 万元
负责人:
吴苑斌
依托单位:
学科分类:
自然语言处理
结题年份:
2024
批准年份:
2020
项目状态:
已结题
项目参与者:
吴苑斌

项目摘要

结项摘要

吴苑斌的其他基金

相似基金

相关文献

中文摘要
作为一类简单有效的文本结构化方法,依存句法分析对信息抽取,语义理解等任务都有重要作用,是自然语言处理基础任务的核心研究方向之一。随着文本分析技术在智能系统中广泛应用,如何扩展依存句法分析应用场景,使其更有效的处理多种语言和多种领域的数据,特别是标注数据稀少的语言和领域,成为了当前依存句法分析的关键问题。..本项课题中,我们将关注面向低资源的依存句法分析。研究统一低资源与高资源的依存分析框架,跨语跨领域场景下依存分析模型与算法。同时,我们也将探究依存分析模型可解释性,研究语言学知识指导下的依存分析错误诊断与异常检测,提升低资源依存分析的稳定性与鲁棒性。具体研究目标包括:1面向依存分析的词表示;2融合异构语料的依存分析编码器;3基于联合学习的依存分析解码器; 4低资源依存分析的可解释性。..预期的研究成果包括:发表国内外学术期刊或会议论文15-20篇,申请专利3-4项,开源低资源依存分析工具。
英文摘要
Being of a simple and effective method for detecting structural information in texts, dependency parsing plays an important role in many information extraction and natural language understanding tasks. Traditionally, dependency parsers are trained and tested on Treebanks with documents from news and official documents in major languages(e.g., English). However, it is always the case that for other languages and text domains, enough annotations of dependency trees are hard to obtain. How to parsing with low resources is therefore crucial to enlarge the application of dependency grammar and attracts recent research attentions...In this proposal, we focus on building a unified dependency parsing model for both high and low resources, and we also propose to investigate the interpretability of the current parsing model which helps us understanding the statistical model better. We hope that by exploring cutting edge cross-lingual cross-domain algorithms and model verification methods, we are able to improve the robustness of dependency parsing, understand the behaviors of them better and benefit various NLP applications.
本项课题主要围绕低资源自然语言处理技术展开,并主要关注依存句法分析为代表的结构化学习任务。主要研究了基于预训练技术的低资源分析技术、基于专家知识的低资源分析技术、基于可解释机器学习的无监督语言结构分析等关键技术。项目主要研究成果归纳如下: (1)在基于预训练技术的低资源分析技术方面,研究了统一基于转移系统的依存句法分析算法;研究了基于隐式词序重排的多语依存句法分析;研究了面向低资源结构化分析的预训练任务;研究了低资源增量学习过程中的灾难性遗忘问题,提出了基于高效参数隔离的持续学习方法;研究了语言建模中的距离泛化问题,尝试建立建模长距离依赖关系的基础模型。(2)在基于专家知识的低资源分析技术方面:研究了基于专家知识的位置编码方法,探索解决多语言依存句法分析位置编码冲突问题;研究了跨领域建模中的词表冲突问题,探索面向低资源学习的动态词表技术。(3)在基于可解释机器学习的无监督语言结构分析方面:研究了基于预训练语言模型的无监督结构分析方法;基于可解释机器学习提出了图结构重要性指标并研究了基于样本重要性的噪声标注识别方法。..课题基本按照预定的计划进行, 达到了项目的预期目标, 并完成了项目预期的研究成果。(1)理论研究成果: 围绕低资源依存句法分析的相关研究成果发表在 15篇国际会议及期刊论文上. 其中国际高水平论文ACL, EMNLP, COLING, AAAI 共发表论文12篇, 其他会议论文 1 篇。(2)资源建设: 发布基于预训练模型的无监督语言结构挖掘工具,无重放连续学习工具,预训练模型动态词表工具。(3) 学术交流: 担任 ACL, EMNLP, NLPCC等国际会议期刊审稿人。参加 ACL, EMNLP, YSSNLP 等国内外会议。(4)人才培养: 指导 3 名博士生, 4名硕士生。
自然语言处理中基于矩阵的结构化学习研究
  • 批准号:
    61402175
  • 项目类别:
    青年科学基金项目
  • 资助金额:
    26.0万元
  • 批准年份:
    2014
  • 负责人:
    吴苑斌
  • 依托单位:
国内基金
海外基金