実例に基づく強化学習法による適応行動発生に関する基礎研究
実例に基づく強化学習法による適応行動発生に関する基礎研究
批准号:
06680365
负责人:
畝見 達夫
金额:
$1.22万
依托单位:
依托单位国家:
日本
项目类别:
Grant-in-Aid for General Scientific Research (C)
财政年份:
1994
资助国家:
日本
项目状态:
已结题
起止时间:
1994 至 --
中文摘要
点击翻译按钮获取中文摘要
英文摘要
強化学習の基本アルゴリズムについて、出力が連続な実数である問題領域において、出力選択肢数を増減させる手法を提案し、コンピュータシミュレーションにより性能を確任した。実例に基づく強化学習法をベースに、参照される頒度の違いにより、より頒繁に参照される出力選択肢の間に新たな選択肢を設定し、選択肢数の数があらかじめ決められた数より多くなったときには、最も参照頒度の小さい選択肢を削除する。これにより、適応的な出力精度の調整が可能となる。倒立振子を用いたコンピュータシミュレーションでは、出力候補を固定とする従来の手法に比べ、計算負荷は増すもののより精密な制御が可能となることが確任された。また強化学習のパラメータを遺伝的アルゴリズムによって最適化するシミュレーション実験を行った。この結果、経験的に人間が設定していた値と同様の値が得られた。ただし、学習率については、徐々に減る傾向となり、理論とは逆になった。さらに、環境変化を行なわず、かつ、個体の評価に学習期間を含めたところ、ボールドウィン効果と思われる現象が観察された。つまり、最初は学習能力が高い個体が発生するが、その後先天的に最適な行動戦略をもった個体にとってかわられる。
期刊论文(6)
专著(0)
科研奖励(0)
会议论文
畝見達夫: "強化学習エージェントの集団行動" マルチエージェントと協調計算. 3. 137-150 (1994)
Tatsuo Unemi:“强化学习代理的集体行为”多代理和协作计算 3. 137-150 (1994)。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
T.Unemi,et al.: "Evolutionary Differentiation of Learning Abilities-" Proceedings of the Forth Intnl.Conf.on Artificial Life. 331-336 (1994)
T.Unemi 等人:“学习能力的进化分化——”第四届人工生命国际会议论文集。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
矢野喜義、増島康弘、平山宣正、畝見達夫: "強化学習エージェントによる道路交通の秩序の発生" 自律分散システムシンポジウム. 297-300 (1995)
Yoshiyoshi Yano、Yasuhiro Masushima、Nobumasa Hirayama、Tatsuo Unemi:“使用强化学习代理生成道路交通秩序”自治分布式系统研讨会 297-300 (1995)。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
An epidemic simulation based on a multi-agent system distributed in a continuous space
-
批准号:21K12064
-
项目类别:Grant-in-Aid for Scientific Research (C)
-
资助金额:$2.66万
-
财政年份:2021
-
负责人:畝見 達夫
-
依托单位:
様々なデータ型のための帰納学習アルゴリズム
-
批准号:05213222
-
项目类别:Grant-in-Aid for Scientific Research on Priority Areas
-
资助金额:$0.77万
-
财政年份:1993
-
负责人:畝見 達夫
-
依托单位:
様々なデータ型のための帰納学習アルゴリズム
-
批准号:04229203
-
项目类别:Grant-in-Aid for Scientific Research on Priority Areas
-
资助金额:$0.96万
-
财政年份:1992
-
负责人:畝見 達夫
-
依托单位:
様々なデ-タ型のための帰納学習アルゴリズム
-
批准号:03245205
-
项目类别:Grant-in-Aid for Scientific Research on Priority Areas
-
资助金额:$1.6万
-
财政年份:1991
-
负责人:畝見 達夫
-
依托单位:
海外基金