世界モデルの獲得と多様な戦略の探索による深層強化学習の汎用性向上
世界モデルの獲得と多様な戦略の探索による深層強化学習の汎用性向上
批准号:
21H03570
负责人:
金子 知適
金额:
$4.16万
依托单位:
依托单位国家:
日本
项目类别:
Grant-in-Aid for Scientific Research (B)
财政年份:
2021
资助国家:
日本
项目状态:
已结题
起止时间:
2021-04-01 至 2024-03-31
关键词:
中文摘要
本応募課題では、思考ゲームを題材に、深層強化学習の汎用性と効率向上の研究を行う。 囲碁、将棋、チェスなどの思考ゲームは AI の到達度を測る試金石として、また AlphaGo が登場して以降は深層強化学習の題材としても注目を集めている。 熟慮して判断の質を高めるためには、エージェントが確率的な推論や思考実験をできるような世界のモデルが必要となる。 推論に適した世界のモデルの学習のために、抽象化と多様性を技術的な核に総合的な学習フレームワークを構築する。 抽象的な表現で世界を学ぶことで汎用性と学習効率を高め、環境とエージェントの多様性に適切な抽象度を学ぶ。 思考ゲーム、特に囲碁、将棋、チェスなどの二人完全情報ゲームでは、ここ数年の AlphaGo から AlphaZero までの研究で、既存手法で作成された AI プレイヤや人間の強さを越えて、大きな技術の進歩があった。 本応募課題ではそれらの成果を踏まえて、思考ゲームを題材に、深層強化学習の汎用性と効率向上の研究を行っている。 全体の計画したなかで世界を抽象的に理解するモデルに関して、エントロピー最大化強化学習を敵対的他者がいる環境に適用する技術と、経験を積むべき優先度に関する新たなモデルに関しては、これまでに十分な成果が得られている。
英文摘要
本応募課題では、思考ゲームを題材に、深層強化学習の汎用性と効率向上の研究を行う。 囲碁、将棋、チェスなどの思考ゲームは AI の到達度を測る試金石として、また AlphaGo が登場して以降は深層強化学習の題材としても注目を集めている。 熟慮して判断の質を高めるためには、エージェントが確率的な推論や思考実験をできるような世界のモデルが必要となる。 推論に適した世界のモデルの学習のために、抽象化と多様性を技術的な核に総合的な学習フレームワークを構築する。 抽象的な表現で世界を学ぶことで汎用性と学習効率を高め、環境とエージェントの多様性に適切な抽象度を学ぶ。 思考ゲーム、特に囲碁、将棋、チェスなどの二人完全情報ゲームでは、ここ数年の AlphaGo から AlphaZero までの研究で、既存手法で作成された AI プレイヤや人間の強さを越えて、大きな技術の進歩があった。 本応募課題ではそれらの成果を踏まえて、思考ゲームを題材に、深層強化学習の汎用性と効率向上の研究を行っている。 全体の計画したなかで世界を抽象的に理解するモデルに関して、エントロピー最大化強化学習を敵対的他者がいる環境に適用する技術と、経験を積むべき優先度に関する新たなモデルに関しては、これまでに十分な成果が得られている。
期刊论文(9)
专著(0)
科研奖励(0)
会议论文
登录
查看更多内容
Residual network for deep reinforcement learning with attention mechanism
具有注意力机制的深度强化学习残差网络
DOI:
--
发表时间:
2021
期刊:
J. Inf. Sci. Eng.
影响因子:
--
作者:
[Tazoe, H., Obata, H., Hara, T., Inoue, M., Tanaka, T., Nishioka, J., H. Zhu and T. Kaneko]
通讯作者:
H. Zhu and T. Kaneko
Local coordination in multi-agent reinforcement learning
多智能体强化学习中的局部协调
DOI:
--
发表时间:
2021
期刊:
International conference on technologies and applications of artificial intelligence
影响因子:
--
作者:
[Sato Yusuke, Morita Masamune, Suzuki Yuki, F. Xu and T. Kaneko]
通讯作者:
F. Xu and T. Kaneko
2048 への方策勾配法の適用
政策梯度法在2048年的应用
DOI:
--
发表时间:
2021
期刊:
第26回ゲームプログラミングワークショップ
影响因子:
--
作者:
[Inoue, M., Mitsunushi, H., Mashita, K., Hanaki, S. Kameyama, H., Matsunaka, T., Kumamoto, Y., Inomata, Y. Hayashi, M., Nagao, S., 荻島 創一, 山下 金子]
通讯作者:
山下 金子
DOI:
10.1109/cog52621.2021.9619068
发表时间:
2021-08
期刊:
2021 IEEE Conference on Games (CoG)
影响因子:
--
作者:
[Zhejie Hu;Tomoyuki Kaneko]
通讯作者:
Zhejie Hu;Tomoyuki Kaneko
3x3盤面の2048の完全解析と強化学習の研究
2048 3x3棋盘完整分析及强化学习研究
DOI:
--
发表时间:
2022
期刊:
第27回ゲームプログラミングワークショップ
影响因子:
--
作者:
[Inoue, M., Shirotani, Y., Morokado, T., Hanaki, S., Kameyama, H., Kofuji, H., Okino, A., Yoshida, M., Miki, S., Shikata, T., Honda, N., Takikawa, T., Morita, M., Nagao, S., 荻島 創一, 山下 金子 中屋敷]
通讯作者:
山下 金子 中屋敷
共 9 条
不完全情報かつ多人数環境で合理的均衡戦略を求める深層強化学習
-
批准号:21K19816
-
项目类别:Grant-in-Aid for Challenging Research (Exploratory)
-
资助金额:$3.99万
-
财政年份:2021
-
负责人:金子 知適
-
依托单位:
海外基金