Fusion of Linguistic and Citation Information in Scientific Literature using Transformer Model

Fusion of Linguistic and Citation Information in Scientific Literature using Transformer Model
复制标题

使用 Transformer 模型融合科学文献中的语言和引文信息

DOI:
10.11517/pjsai.jsai2022.0_3m4gs404
复制
发表时间:
2022
期刊:
Proceedings of the Annual Conference of JSAI
影响因子:
--
通讯作者:
坂田 一郎
坂田 一郎
中科院分区:
--
文献类型:
--
作者:
大知 正直;城 真範;森 純一郎;坂田 一郎

文献摘要

相似文献

2017 年に発表された Transformer モデルは当初自然言語処理分野での利用が進んだが, その後画像処理, ネットワーク等多様な分野での活用が広がっている. Transformer モデルは, 大規模データを用いた学習済みモデルの公開, 個別のタスクへ新しいデータを適用しファインチューニングを行える等の利点がある. 学術文献には, 言語, 引用, 図表の画像など多様なデータが含まれている. しかし, これまで各データを個別に利用, 抽出した特徴量を組み合わせて分類や回帰を行った研究が主で, データ間の相互作用を十分に考慮していなかった. 本稿では, 学術文献のデータのうち言語情報と引用情報を Transformer モデルを用い, end2end で融合する手法を提案する. Web of Science から抽出したデータセットを用い, 出版 3 年後の被引用数が上位 20% となる論文の分類を行なったところ, 提案手法は個別の情報だけを用いるよりも F 値を 2.6~ 6.0 ポイント改善した. 本手法によって, 学術文献の持つ多様なデータを end2end に融合することが可能になり, 様々な分類, 予測の精度向上を容易に図れる可能性を示している.