Automatic acquisition of hyponymy relations from HTML documents

Automatic acquisition of hyponymy relations from HTML documents
复制标题

自动获取HTML文档的上下位关系

DOI:
10.5715/jnlp.12.125
复制
发表时间:
2005
期刊:
Knowl. Based Syst.
影响因子:
--
通讯作者:
Kentaro Torisawa
Kentaro Torisawa
中科院分区:
--
文献类型:
--
作者:
Keiji Shinzato;Kentaro Torisawa

文献摘要

被引文献

相似文献

本稿では, HTML, 文書より単語間の上位下位関係を自動獲得する手法を提案する.従来より, 単語間の上位下位関係は自然言語処理において重要な知識であると見なされており, 多くの自動獲得手法が提案されてきた.しかし, それらの多くは名詞句の並置などの文の表層的なパターンに注目するものであり, 広範な上位下位関係を獲得することが難しいという問題を抱えている.そのため本稿で提案する手法は, これらとは異なるアプローチをとる.より具体的には, 1) HTMLタグにより与えられるHTML文書の構造, 2) 従来より情報検索などで使われてきたdf, idfなどの統計量, 3) 大量のテキストから獲得した名詞と動詞の係り受け関係, 4) 予備実験より得られた知見に基づくヒューリスティックなルール, の4つの要素を組み合わせることで, 様々な単語間の上位下位関係を自動的に獲得することを目指す.