Documents similarity measurement using field association terms

Documents similarity measurement using field association terms
复制标题

DOI:
10.1016/s0306-4573(03)00019-0
复制
发表时间:
2003-11-01
影响因子:
8.6
通讯作者:
Aoe, J
Aoe, J
中科院分区:
计算机科学1区
文献类型:
--
作者:
Atlam, ES;Fuketa, M;Aoe, J

文献摘要

被引文献

相似文献

传统的文本分析和信息检索方法通过考虑文本中的所有信息来测量文档相似性,这对于处理异构主题领域中的大型文本集合来说是相对低效的。本文概述了一个新的文本处理系统FA-Sim,是有用的检索信息在大型异构文本和识别内容相似性的文本摘录。FA-Sim是基于灵活的文本匹配程序,在各种背景和各种领域的排名。FA-Sim通过使用特定的字段关联(FA)术语来测量文本相似性,而不是通过比较所有文本信息。与其他两种分析方法相比,FA-Sim的文本相似度更快、更高。因此,召回率和准确率比这两种传统方法分别提高了39%和37%。(C)2003 Elsevier Ltd.保留所有权利。
Conventional approaches to text analysis and information retrieval which measured document similarity by using considering all of the information in texts are a relatively inefficiency for processing large text collections in heterogeneous subject areas. This paper outlined a new text manipulation system FA-Sim that is useful for retrieving information in large heterogeneous texts and for recognizing content similarity in text excerpts. FA-Sim is based on flexible text matching procedures carried out in various contexts and various field ranks. FA-Sim measures texts similarity by using specific field association (FA) terms instead of by comparing all text information. Similarity between texts is faster and higher by using FA-Sim than other two analysis methods. Therefore, Recall and Precision significantly improved by 39% and 37% over these two traditional methods. (C) 2003 Elsevier Ltd. All rights reserved.