Developing Corpus of Japanese-English Singular Sentence Textual Entailment

Developing Corpus of Japanese-English Singular Sentence Textual Entailment
复制标题

日英单句文本蕴涵语料库开发

DOI:
10.1109/icaicta.2016.7803130
复制
发表时间:
2016
期刊:
Proceedings of The 2016 International Conference on Advanced Informatics: Concepts, Theory and Application
影响因子:
--
通讯作者:
Hitoshi Isahara
Hitoshi Isahara
中科院分区:
--
文献类型:
--
作者:
Daiki Hayakawa;Masatoshi Tsuchiya;Hitoshi Isahara

文献摘要

相似文献

跨语言文本蕴涵是近年来提高跨语言信息可靠性的重要课题之一,受到越来越多的关注。本文介绍了我们正在进行的项目,以开发一个日英CLTE语料库组成的许多单数句子对,被标记为无论是蕴涵或unentailed。本文提出(1)使用双语平行语料库作为CLTE单句对的源;(2)利用源平行语料库的层次文档结构从大量可能的句子对中选择合适的句子对。对Wikipedia的京都文章的日英双语语料库的实验表明,我们提出的方法比随机抽样方法更有希望构建CLTE语料库。
There is an increasing interest against cross lingual textual entailment (CLTE), which is one of the important tasks to improve cross lingual information reliablity, in recent years. This paper describes our ongoing project to develope a Japanese-English CLTE corpus consisting of many singular sentence pairs which are labeled as either entailed or unentailed. This paper proposes (1) using a bilingual parallel corpus as a source of CLTE singular sentence pairs and (2) using the hierachical document structure of the source parallel corpus to select appropriate sentence pairs among vast possible ones. The experiment against Japanese-English Bilingual Corpus of Wikipedia's Kyoto Articles shows that our proposing method is more promising to construct a CLTE corpus than a random sampling method.