A Method of Refining Topic Models Based on Term and Document Frequencies.

A Method of Refining Topic Models Based on Term and Document Frequencies.
复制标题

一种基于术语和文档频率细化主题模型的方法。

DOI:
10.11309/jssst.36.4_25
复制
发表时间:
2019
期刊:
影响因子:
--
通讯作者:
東和幸,高橋仁,中川博之,土屋達弘
東和幸,高橋仁,中川博之,土屋達弘
中科院分区:
--
文献类型:
--
作者:
Y. Kichikawa;H. Iyetomi;T. Iino;and H. Inoue;本田量久;東和幸,高橋仁,中川博之,土屋達弘

文献摘要

相似文献

近年では, 開発環境の変化に伴って開発者が大量の自然言語文書を扱う機会が増えており, 文書をトピック分類するためのトピックモデルである LDA が注目されている. 文書のトピック分類を行う際, 分類の精度をあげるために前処理として, 分類の妨げとなる単語をストップワードとして除去することが重要であるが, 通常のストップワードリストでは対象文書にのみ頻出する単語に対応できないという問題があった. また, 1 トピックに集約されるべき文書が複数トピックに分散してしまう問題があった. 本稿では, これらの問題を解消するため, LDA 適用の前後に対象文書からのストップワード抽出と類似トピック統合の 2 種類の処理を追加する. 前処理では, Document Frequency と単語の類似度を用いて, 対象文書からストップワードリストを作成する. また, 後処理では分類されたトピックについて構成する単語の類似度からそれぞれのトピック間距離を算出し類似トピックを統合する. LDA を用いたメーリングリストの分類に本手法を適用し, 既存手法と比較することで, トピック分類の精度が向上することを確認した.