课题基金 / 基金详情

Intelligent Information Retrieval Systems for Text Databases of Japanese and Chinese Classics

Intelligent Information Retrieval Systems for Text Databases of Japanese and Chinese Classics
日汉典籍文本数据库智能信息检索系统
批准号:
22H03903
负责人:
肖 川
金额:
$10.82万
依托单位:
依托单位国家:
日本
项目类别:
Grant-in-Aid for Scientific Research (B)
财政年份:
2022
资助国家:
日本
项目状态:
未结题
起止时间:
2022-04-01 至 2026-03-31

项目摘要

项目成果

肖 川的其他基金

相似基金

相关文献

中文摘要
翻译
点击翻译按钮获取中文摘要
英文摘要
本年度は、和漢書テキストに対する漢文固有表現の抽出と統合を行った。既存の和漢書テキストデータベースは、情報検索機能には十分対応できていない。主な原因は、漢文の文法のため、和漢書テキストの多くには固有名詞の別称や省略が存在し、検索のキーワードと完全に一致する結果しか検出できない。固有名詞の別称を含む結果を検出するため、事前に固有名詞とその別称を和漢書テキストから抽出することが求められる。ただ、現代中国語と異なり、漢文のテキストには句読点がないことが多いため、句読点のないデータを扱うことは困難な課題である。以上の問題に対処するため、トークンフリーの事前学習済みモデルを活用した。これまでの最も広く使用されている事前学習済み言語モデルは、単語や部分単語単位に対応するトークンのシーケンスに作用する。これに対して、トークンフリーのモデルは、生のテキスト(バイトまたは文字)に直接作用し、多くの利点を持っている。例えば、任意の言語のテキストを処理することができ、ノイズに対してより堅牢であり、複雑でエラーが発生しやすいテキスト前処理パイプラインを取り除くことができる。それらの利点を考えて、ByT5というトークンフリーのモデルに基づく漢文の事前学習済み言語モデルを開発し、漢文の固有名詞認識のために学習済みモデルを微調整(fine-tune)した。微調整されたモデルは、既存の手法を大幅に上回る性能を発揮し、いわゆるグラウンドトゥルース(C-CLUE)のエラーさえも訂正できる。初期の結果はDEIM 2023学会で発表された。詳細な研究成果はEMNLP 2023に提出される予定である。さらに、データ統合のため、意味的に等価なコンテンツの識別手法を開発し、研究成果はVLDB 2023学会で発表される予定である。
期刊论文(5)
专著(0)
科研奖励(0)
会议论文
経路を用いた高速なサブグラフ編集距離問合せ
使用路径快速子图编辑距离查询
DOI: --
发表时间: 2023
期刊:
影响因子: --
作者: [堀内 美聡, 佐々木 勇和, 肖 川, 鬼塚 真]
通讯作者: 鬼塚 真
創薬のための分子グラフ推薦システム
用于药物发现的分子图推荐系统
DOI: --
发表时间: 2023
期刊:
影响因子: --
作者: [Sheng Hu, Ichigaku Takigawa, Chuan Xiao]
通讯作者: Chuan Xiao
Token-Free Cross-Lingual Named Entity Recognition for Classical Chinese
文言文无令牌跨语言命名实体识别
DOI: --
发表时间: 2023
期刊:
影响因子: --
作者: [Zhongqing Jiang, Zengqing Wu, Chuan Xiao]
通讯作者: Chuan Xiao
DOI: 10.14778/3574245.3574269
发表时间: 2022-12
期刊: Proc. VLDB Endow.
影响因子: --
作者: [Kejing Lu;Y. Ishikawa;Chuan Xiao]
通讯作者: Kejing Lu;Y. Ishikawa;Chuan Xiao
和漢書テキストデータベースに対する知的情報検索システムの研究開発
  • 批准号:
    23K25157
  • 项目类别:
    Grant-in-Aid for Scientific Research (B)
  • 资助金额:
    $5.16万
  • 财政年份:
    2024
  • 负责人:
    肖 川
  • 依托单位:
海外基金