基于可比语料的多语言文本聚类研究
批准号:
70903032
项目类别:
青年科学基金项目
资助金额:
19.0 万元
负责人:
章成志
依托单位:
学科分类:
数字治理与信息资源管理
结题年份:
2012
批准年份:
2009
项目状态:
已结题
项目参与者:
颜端武、薛春香、刘明岩、许应楠、王雪芬
中文摘要
随着全球一体化进程加快、多语言信息资源激增,针对多语言文本聚类的研究尤为迫切。当前多语言文本聚类方法主要依赖于双语词典、多语主题词表或平行语料,由于这些资源获取成本高、常与聚类文本所属领域不兼容,限制了多语言文本聚类的发展,需要探索有效的多语言文本聚类方法。鉴于可比语料易获取、易与领域兼容,且多语言相似词在可比语料上有相似语境分布,本项目将可比语料用于多语言文本聚类,拟以申请者已开发的主题聚类原型系统为基础,进行如下三方面研究:1.结合短语分析和机器学习,提取多语言文本主题;2.生成可比语料,用可比语料计算跨语言文本主题间相似度,进而计算跨语言文本间相似度;3.在上述基础上,以平行语料为约束实现多语言文本聚类。本项目难点是紧扣多语言文本聚类需求,有效解决以上问题,核心问题是基于可比语料的跨语言语言文本主题间相似度计算。本项目旨在探寻提高多语言文本聚类性能的方法,有效解决多语言文本聚类问题。
英文摘要
随着全球一体化进程加快、多语言信息资源激增,针对多语言文本聚类的研究尤为迫切。当前多语言文本聚类方法主要依赖于双语词典、多语主题词表或平行语料,由于这些资源获取成本高、常与聚类文本所属领域不兼容,限制了多语言文本聚类的发展,需要探索有效的多语言文本聚类方法。鉴于可比语料易获取、易与领域兼容,且多语言相似词在可比语料上有相似语境分布,本项目将可比语料用于多语言文本聚类,以申请者已开发的主题聚类原型系统为基础,进行如下几个方面的研究。.1. 结合短语分析和机器学习,提取多语言文本主题; .2. 生成可比语料,用可比语料计算跨语言文本主题间相似度,进而计算跨语言文本间相似度;.3. 在上述基础上,以平行语料为约束实现多语言文本聚类。
期刊论文列表
专著列表
科研奖励列表
会议论文列表
专利列表
登录
查看更多内容
DOI:
--
发表时间:
2011-08
期刊:
Chinese Journal of Library and Information Science
影响因子:
--
作者:
[Chengzhi Zhang]
通讯作者:
Chengzhi Zhang
DOI:
--
发表时间:
--
期刊:
现代图书情报技术
影响因子:
--
作者:
[康小丽, 章成志]
通讯作者:
章成志
DOI:
--
发表时间:
--
期刊:
Journal of Information and Computational Science
影响因子:
--
作者:
[Shuo Xu, Xiaodong Qiao, Lijun Zhu, Yunliang Zhang, Lin Li]
通讯作者:
Lin Li
DOI:
--
发表时间:
--
期刊:
现代图书情报技术
影响因子:
--
作者:
[刘飒, 章成志]
通讯作者:
章成志
DOI:
--
发表时间:
--
期刊:
现代图书情报技术
影响因子:
--
作者:
[黄红霞, 章成志]
通讯作者:
章成志
共 7 条
基于学术文献全文内容的细粒度算法实体抽取与评估研究
-
批准号:72074113
-
项目类别:面上项目
-
资助金额:50.0万元
-
批准年份:2020
-
负责人:章成志
-
依托单位:
国内基金
海外基金