統計モデルに基づく大規模テキストへの言語情報付与及びテキストからの言語知識獲得
統計モデルに基づく大規模テキストへの言語情報付与及びテキストからの言語知識獲得
批准号:
09780338
负责人:
宇津呂 武仁
金额:
$1.28万
依托单位国家:
日本
项目类别:
Grant-in-Aid for Encouragement of Young Scientists (A)
财政年份:
1997
资助国家:
日本
项目状态:
已结题
起止时间:
1997 至 1998
中文摘要
本研究では,大量のテキストデータに対して豊富な言語情報を効率よく付与するという手法の研究を行った.さらに,豊富な言語情報が付与されたテキストから,様々な言語現象に関する知識を獲得する手法について研究をおこなった.本年度の研究項目は次の2点である.1. 豊富な言語情報が付与されたテキストから,様々な言語現象に関する知識を獲得する際に,それぞれの言語現象の特性に応じて,最適な言語知識獲得手法を適用し,言語知識獲得を行う.2. 獲得された大規模言語知識が,実際の言語処理の性能向上にどの程度寄与するかを理論的・実験的に評価・検証する.まず,第1点については,言語知識獲得に適用可能な代表的手法として,確率モデル学習および機械学習の二種類の手法に着目し,それぞれの言語知識の獲得に最適な手法について研究を行った.具体的には,確率モデル学習の手法が適した例題として,(1)日本語形態素解析,(2)統語解析のための動詞語彙知識の学習,の二つについて,モデルを記述する言語情報の記述の細かさを徐々に調整しながら,なるべく解析誤りを少なくする方向にモデルを自動改良していく手法を開発した.また,機械学習の手法が適した例題として,(3)日本語従属節の係り受け関係の解析,について,従属節の様々な特徴のうち,従属節間の係り受け関係の特定に最も寄与する特徴を選択的に学習することに成功した.第2点については,まず,(2)の統語解析のための動詞語彙知識の学習において,統語的曖昧性の解消の性能に関して,幾つかの対照モデルと比較して,確率モデル学習の手法により構築された最適モデルが最も優れでいることを示した.また,(3)の日本語従属節の係り受け関係の解析において,獲得された言語知識を用いてあらかじめ従属節間の係り受け関係を特定しておくことにより,文全体の係り受け解析の性能が向上することを示した.
英文摘要
本研究では,大量のテキストデータに対して豊富な言語情報を効率よく付与するという手法の研究を行った.さらに,豊富な言語情報が付与されたテキストから,様々な言語現象に関する知識を獲得する手法について研究をおこなった.本年度の研究項目は次の2点である.1. 豊富な言語情報が付与されたテキストから,様々な言語現象に関する知識を獲得する際に,それぞれの言語現象の特性に応じて,最適な言語知識獲得手法を適用し,言語知識獲得を行う.2. 獲得された大規模言語知識が,実際の言語処理の性能向上にどの程度寄与するかを理論的・実験的に評価・検証する.まず,第1点については,言語知識獲得に適用可能な代表的手法として,確率モデル学習および機械学習の二種類の手法に着目し,それぞれの言語知識の獲得に最適な手法について研究を行った.具体的には,確率モデル学習の手法が適した例題として,(1)日本語形態素解析,(2)統語解析のための動詞語彙知識の学習,の二つについて,モデルを記述する言語情報の記述の細かさを徐々に調整しながら,なるべく解析誤りを少なくする方向にモデルを自動改良していく手法を開発した.また,機械学習の手法が適した例題として,(3)日本語従属節の係り受け関係の解析,について,従属節の様々な特徴のうち,従属節間の係り受け関係の特定に最も寄与する特徴を選択的に学習することに成功した.第2点については,まず,(2)の統語解析のための動詞語彙知識の学習において,統語的曖昧性の解消の性能に関して,幾つかの対照モデルと比較して,確率モデル学習の手法により構築された最適モデルが最も優れでいることを示した.また,(3)の日本語従属節の係り受け関係の解析において,獲得された言語知識を用いてあらかじめ従属節間の係り受け関係を特定しておくことにより,文全体の係り受け解析の性能が向上することを示した.
期刊论文(15)
专著(0)
科研奖励(0)
会议论文
登录
查看更多内容
北内 啓: "誤り駆動型の確率モデル学習による日本語形態素解析" 情報処理学会研究報告. 97-NL-124. 41-48 (1998)
Kei Kitauchi:“使用错误驱动概率模型学习的日语形态分析”日本信息处理学会研究报告 97-NL-124(1998)。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
Takehito Utsuro: "Lexical Knowledge Acquisition from Corpora" Proceedings of JSPS-HITACHI Workshop on New Challenges in Natural Language Processing and its Application,-Integration of Linguistics-based and Corpus-based Approaches-. 82-87 (1998)
Takehito Utsuro:“从语料库获取词汇知识”JSPS-HITACHI 自然语言处理及其应用新挑战研讨会论文集,-基于语言学和基于语料库的方法的集成-。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
Takehito Utsuro: "Maximum Entropy Model Learning of Subcategorization Preference" Proceedings of the 5th Workshop on Very Large Corpora. 246-260 (1997)
Takehito Utsuro:“子类别偏好的最大熵模型学习”第五届超大型语料库研讨会论文集。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
宇津呂 武仁: "コーパスを用いた動詞格フレーム辞書構築のための支援環境" 自然言語処理シンポジウム「実用的な自然言語処理に向けて」論文集. (1997)
Takehito Utsuro:“使用语料库构建动词格框架字典的支持环境”自然语言处理研讨会论文集“迈向实用自然语言处理”(1997)
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
中塚 幸毅: "コーパスからの格フレーム半自動獲得のための支援環境の構築" 言語処理学会第4回年次大会論文集. 442-445 (1998)
Koki Nakatsuka:“从语料库中半自动获取案例框架的支持环境的构建”语言处理协会第四届年会记录442-445(1998)。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
共 15 条
実世界の大規模言語資源からの翻訳知識獲得に基づく機械翻訳モデルの研究
-
批准号:16700141
-
项目类别:Grant-in-Aid for Young Scientists (B)
-
资助金额:$2.37万
-
财政年份:2004
-
负责人:宇津呂 武仁
-
依托单位:
WWW上の多言語文書から翻訳知識を発見するための知的インタフェースの研究
-
批准号:15017245
-
项目类别:Grant-in-Aid for Scientific Research on Priority Areas
-
资助金额:$2.56万
-
财政年份:2003
-
负责人:宇津呂 武仁
-
依托单位:
言語横断情報検索および多言語情報抽出の技術を利用した翻訳知識獲得の研究
-
批准号:14780275
-
项目类别:Grant-in-Aid for Young Scientists (B)
-
资助金额:$3.07万
-
财政年份:2002
-
负责人:宇津呂 武仁
-
依托单位:
大規模テキストデータに基づく名詞意味辞書の構築及び自然言語理解における利用
-
批准号:12780282
-
项目类别:Grant-in-Aid for Encouragement of Young Scientists (A)
-
资助金额:$1.73万
-
财政年份:2000
-
负责人:宇津呂 武仁
-
依托单位:
大規模テキストデータに基づく名詞意味辞書の構築及び自然言語理解における利用
-
批准号:11780275
-
项目类别:Grant-in-Aid for Encouragement of Young Scientists (A)
-
资助金额:$0.9万
-
财政年份:1999
-
负责人:宇津呂 武仁
-
依托单位:
自然言語テキストからの語彙的知識獲得および獲得結果を利用した効率的文解析法
-
批准号:07780326
-
项目类别:Grant-in-Aid for Encouragement of Young Scientists (A)
-
资助金额:$0.64万
-
财政年份:1995
-
负责人:宇津呂 武仁
-
依托单位:
海外基金