课题基金 / 基金详情

Evolution of Reward Appraisal Systems in Environments with Sequential Decision Making

Evolution of Reward Appraisal Systems in Environments with Sequential Decision Making
顺序决策环境中奖励评估系统的演变
批准号:
19K12118
负责人:
森山 甲一
金额:
$2.83万
依托单位国家:
日本
项目类别:
Grant-in-Aid for Scientific Research (C)
财政年份:
2019
资助国家:
日本
项目状态:
已结题
起止时间:
2019-04-01 至 2024-03-31

项目摘要

项目成果

相似基金

相关文献

中文摘要
翻译
点击翻译按钮获取中文摘要
英文摘要
本研究では,計算機シミュレーションにより,行動主体(エージェント)が複数存在する環境における協力行動の発生過程を議論する.現実に近い連続的な意思決定を必要とする環境として,複数のエージェントが「協力すべき」ゲームを対象とし,個々が意思決定方策を強化学習により獲得する.意思決定の結果を各自が自己評価して学習に反映させるものとした時,エージェント間の協力をもたらす自己評価システムが進化により発生するか否か,およびその発生のための要件について考察する.2022年度は,2021年度までに得られた知見をさらに深めることが行われた.内部報酬(自己評価)を利用した好奇心探索を,追跡問題と呼ばれるマルチエージェント環境へ適用することで,強化学習のみと比べてより多くの協調行動が得られることが示されていたが,その要因を考察した.その結果,強化学習のみでは個々が獲物を追いかけることで,互いに環境内で衝突してしまい,結果として獲物を取り逃がしていたが,好奇心探索を用いた場合には,一部のエージェントが回り込むなどの動作を学習することで,互いの衝突を減らすことが見られた.これは,自己評価によって探索を促進することで,結果として協力行動が得られたと解釈できる.また,自己評価システムの進化に関する研究については以下のとおりである.ゲーム空間上のエージェントの位置関係に基づくものについて,新たに人工ポテンシャル場の考えを導入し,そのポテンシャル関数を進化計算で調整することにより,ゲームにおいてより多くの得点を獲得することに成功した.一方で,2人同時手番ゲームで有効性が確認された,より一般的な自己評価システムの進化の研究では,連続的な意思決定を要するゲームへ適用したところ,残念ながらまだ満足する結果が得られておらず,さらなる検討が必要である.
期刊论文(14)
专著(0)
科研奖励(0)
会议论文
エージェント間の距離がタスク達成に影響する環境下における報酬の制御
在代理之间的距离影响任务完成的环境中控制奖励
DOI: --
发表时间: 2021
期刊:
影响因子: --
作者: [中田瑛, 森山甲一, 松井藤五郎, 武藤敦子, 犬塚信博]
通讯作者: 犬塚信博
強化学習による交差流歩行者エージェントの行動規則の自動生成とその評価
使用强化学习自动生成和评估横流行人代理的行为规则
DOI: --
发表时间: 2022
期刊:
影响因子: --
作者: [木村哲, 森山甲一, 武藤敦子, 松井藤五郎, 犬塚信博]
通讯作者: 犬塚信博
強化学習による衝突回避エージェントモデルの自動生成
使用强化学习自动生成防撞代理模型
DOI: --
发表时间: 2020
期刊:
影响因子: --
作者: [木村哲, 森山甲一, 武藤敦子, 松井藤五郎, 犬塚信博]
通讯作者: 犬塚信博
Open-Loop MCTSの木の再利用における適切な初期値設定
开环 MCTS 树重用的适当初始值设置
DOI: --
发表时间: 2022
期刊:
影响因子: --
作者: [横川滉太, 森山甲一, 武藤敦子, 松井藤五郎, 犬塚信博]
通讯作者: 犬塚信博
14
    海外基金