自然言語処理によるフリーアンサーの自動解析法の開発と評価
自然言語処理によるフリーアンサーの自動解析法の開発と評価
批准号:
06301102
负责人:
坂野 達郎
金额:
$1.92万
依托单位国家:
日本
项目类别:
Grant-in-Aid for Co-operative Research (A)
财政年份:
1994
资助国家:
日本
项目状态:
已结题
起止时间:
1994 至 1995
中文摘要
点击翻译按钮获取中文摘要
英文摘要
社会科学及び行動科学の研究において、アンケート調査のフリーアンサ一分析は体系的な分析方法が確立されていない。本研究では、フリーアンサーの自動解析法の開発を最終目標に起き、その第一段階として、フリーアンサーに記載された情報の自動カテゴリー化を支援するシステムの開発を行なった。まず、自然言語に関するいっさいの知識を用いずに、単語を構成する要素から形式的類似性を計算するアルゴリズムを作成し、そのアルゴリズム実現のソフトを開発した.形式的類似性は、以下のように定義した。すなわち、m種類の記号から作り出される長さがnの記号列は、理論的にはm^n個ある。したがって、ある調査から得られたテキストを構成するすべての長さnの記号列を調べ、その種類の数をPとすると、P≦m^nとなる.また、長さn以下の記号列すべての種類も有限でその数をP^*とするとP^*≦Σm^nとなる。このようにして得られた記号列の集合を、{P_j}とする。任意のテキストAとB類似性は、次のように定義した。テキストAを構成する長さn以下の記号列をすべて調べ、記号列P_jの出現した頻度をa_j、a_<j2>から作られるP^*次元のベクトルをv_aとする。同様にして、テキストBを構成する長さn以下の記号列をすべて調べ、記号列P_jの出現した頻度をb_j、b_jから作られるP^*次元のベクトルをv_bとする。このとき、類似度r_<ab>=(v_a、v_b)/IIv_<2a>ll・llv_bllただし、(v_a、v_b)は、内積、llv_allはノルムとする。次に、調査から得られたテキストすべてについて、相互の類似度を計算し、これを元にクラスター分析を行う。そして、クラスター分析の結果をもとに、調査分析者がカテゴリーの検討を行い、各カテゴリーごとのネ-ミングを行う。この方法により、言語個有の文法規則、および分野固有の意味関係に関する既存の知識を前提とせずに、大量のテキストデータを自動的に処理し、類似性に基づきカテゴリー化の支援をすることができる。この方法を、2つのことなる分野(「地域福祉に関する調査」と「計画効果の測定指標に関する捜査」)の調査データに適用した。その結果、フリーアンサー部分で挙げられた新規施策の分類、および計画評価の視点としてあげられた自由回答の分類に実用性があることが確認された。
期刊论文(0)
专著(0)
科研奖励(0)
会议论文
事例ベースを用いた排泄介護支援システムの構築
-
批准号:07308031
-
项目类别:Grant-in-Aid for Co-operative Research (A)
-
资助金额:$2.37万
-
财政年份:1995
-
负责人:坂野 達郎
-
依托单位: