不完全情報かつ多人数環境で合理的均衡戦略を求める深層強化学習
不完全情報かつ多人数環境で合理的均衡戦略を求める深層強化学習
批准号:
21K19816
负责人:
金子 知適
金额:
$3.99万
依托单位:
依托单位国家:
日本
项目类别:
Grant-in-Aid for Challenging Research (Exploratory)
财政年份:
2021
资助国家:
日本
项目状态:
已结题
起止时间:
2021-07-09 至 2024-03-31
关键词:
中文摘要
点击翻译按钮获取中文摘要
英文摘要
最大人工知能分野の強化学習では、環境の中で自律的に行動するAIエージェントを想定し、そのエージェントが試行錯誤を通じて振る舞いを学習する手法を扱う。本研究の目的は、不完全情報かつ多人数のゲームを題材に、モデルを持つ深層強化学習に関する基盤技術を開発し、より広い分野においてAIエージェントの性能向上を実現することである。本研究では深層強化学習の扱う対象を広げるために、現実に近い複雑さを持つ問題の例として、不完全情報かつ多人数のゲームを扱う。不完全情報とは、観測できない状態が存在することであり、多人数とは、状況によって敵にも味方にもなりうる他者が存在することである。従来技術では他者を全て環境の一部とみなして妥協していたところを、不完全情報かつ多人数を扱うことに適したモデルの獲得と確率的な推論を行う学習フレームワークを実現する。二人完全情報ゲームで成果をあげた Alpha Zero と比較すると、不完全情報のために相手に手を読まれる度合いを考慮した,数理的なモデル化と探索を行う。ポーカーで成果を上げた Counterfactual Regret最小化 と比較すると、重要な範囲に絞って強化学習を行うことで計算コストを軽減し、より大きな問題に適用可能とする。現在までに、研究計画に沿って数理的な手法の検討と様々なモデルでの計算機実験による性能評価を進めた。とくに、信念状態で不完全な情報を統合して表現する手法とチームでの協調を効率的に学ぶ手法は国際会議ですでに採録されている。
期刊论文(0)
专著(0)
科研奖励(0)
会议论文
登录
查看更多内容
Local coordination in multi-agent reinforcement learning
多智能体强化学习中的局部协调
DOI:
--
发表时间:
2021
期刊:
International conference on technologies and applications of artificial intelligence
影响因子:
--
作者:
[Sato Yusuke, Morita Masamune, Suzuki Yuki, F. Xu and T. Kaneko]
通讯作者:
F. Xu and T. Kaneko
Improve counterfactual regret minimization agents training by setting limitations of numbers of steps in games
通过设置游戏步数限制来改进反事实遗憾最小化代理训练
DOI:
--
发表时间:
2021
期刊:
26th game programming workshop
影响因子:
--
作者:
[Ishikawa Daisuke, Suzuki Yuki, Kurokawa Chikako, Ohara Masayuki, Tsuchiya Misato, Morita Masamune, Yanagisawa Miho, Endo Masayuki, Kawano Ryuji, Takinoue Masahiro, C. Yi and T. Kaneko]
通讯作者:
C. Yi and T. Kaneko
Prediction of werewolf players by sentiment analysis of game dialogue in japanese
通过日语游戏对话情感分析预测狼人玩家
DOI:
--
发表时间:
2021
期刊:
26th game programming workshop
影响因子:
--
作者:
[Yusuke Sato, Masahiro Takinoue, Y. Sun and T. Kaneko]
通讯作者:
Y. Sun and T. Kaneko
3x3盤面の2048の完全解析と強化学習の研究
2048 3x3棋盘完整分析及强化学习研究
DOI:
--
发表时间:
2022
期刊:
第27回ゲームプログラミングワークショップ
影响因子:
--
作者:
[Inoue, M., Shirotani, Y., Morokado, T., Hanaki, S., Kameyama, H., Kofuji, H., Okino, A., Yoshida, M., Miki, S., Shikata, T., Honda, N., Takikawa, T., Morita, M., Nagao, S., 荻島 創一, 山下 金子 中屋敷]
通讯作者:
山下 金子 中屋敷
Improving counterfactual regret minimization agents training in card game cheat using ordered abstraction
使用有序抽象改进纸牌游戏作弊中的反事实后悔最小化代理训练
DOI:
--
发表时间:
2021
期刊:
Advances in computers and games
影响因子:
--
作者:
[Hayakawa Masayuki, Kishino Yusuke, Takinoue Masahiro, C. Yi and T. Kaneko]
通讯作者:
C. Yi and T. Kaneko
共 9 条
世界モデルの獲得と多様な戦略の探索による深層強化学習の汎用性向上
-
批准号:21H03570
-
项目类别:Grant-in-Aid for Scientific Research (B)
-
资助金额:$4.16万
-
财政年份:2021
-
负责人:金子 知適
-
依托单位:
海外基金