強化学習を実問題に応用する際に重要となる報酬および罰の設計指針に関する研究
強化学習を実問題に応用する際に重要となる報酬および罰の設計指針に関する研究
批准号:
13780316
负责人:
宮崎 和光
金额:
$1.34万
依托单位国家:
日本
项目类别:
Grant-in-Aid for Young Scientists (B)
财政年份:
2001
资助国家:
日本
项目状态:
已结题
起止时间:
2001 至 2002
中文摘要
点击翻译按钮获取中文摘要
英文摘要
強化学習を実問題に応用するためには報酬および罰の設計が重要となる。現在、この問題に対峙した手法として罰回避政策形成アルゴリズム(PARP)が知られている。当初、本研究課題では、PARPを多種類の報酬および罰が存在する環境下に拡張することを進めていた。しかしその過程で、PARPが有する膨大な状態空間へは適用しづらいという欠点が無視できなくなり、この問題への対応を先行して行うこととした。一般にPARPは、状態数の2乗のオーダーのメモリを要する。膨大な状態空間を有する多くの実問題では、このことが制約となり、学習が困難となる場合がある。そこで本研究課題では、まず初めに、状態遷移の一部が既知の離散マルコフ決定過程を対象に、状態数のオーダーのメモリで学習を可能とする手法を提案した。実問題としてオセロゲームを取り上げ提案手法の有効性を確認した。さらにより一般的な問題に適用すべく、対象問題クラスの拡張を行った。具体的には、PARPをProfit Sharingと呼ばれる強化学習手法と適切に融合させることで、非マルコフ的環境として知られる部分観測マルコフ決定過程(POMDPs)の一部のクラスまでも学習の対象とする手法を提案した。TeamBotsと呼ばれるサッカーサーバへ適用することで提案手法の有効性を確認した。上記の成果を踏まえ現在は、ふたつの方向で研究を進めている。ひとつは対象問題クラスのさらなる拡大である。これに関しては、現在、PARPとの融合を視野に入れつつ、Profit SharingのPOMDPs全体への拡張を行っている段階である。もうひとつは、複数種類の報酬および罰への拡張である。こちらに関しては、PARPを複数組み合わせることである程度実現可能であると考えおり、具体的なアルゴリズムならびに実装例を構築している最中である。これにより当初の目的である報酬および罰の設計指針がより明確になるものと考えている。
期刊论文(6)
专著(0)
科研奖励(0)
会议论文
登录
查看更多内容
宮崎和光: "罰を回避するProfit Sharingの提案"第45回自動制御連合講演会. 167-170 (2002)
宫崎一光:“利润分享以避免惩罚的提案”第 45 届自动控制协会会议 167-170 (2002)。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
宮崎和光: "罰を回避する合理的政策の学習"人工知能学会誌. 15・2. 148-156 (2001)
宫崎一光:“学习合理的政策以避免惩罚”人工智能学会杂志15・2(2001)。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
宮崎和光: "罰を回避する合理的政策の学習"人工知能学会誌. 16・2. 148-156 (2001)
宫崎一光:“学习合理的政策以避免惩罚”人工智能学会杂志16・2(2001)。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
Kazuteru Miyazaki: "Reinforcement Learning for Penalty Avoiding Profit Sharing and its Application to the Soccer Game"ICONIP' 02-SEAL' 02-FSKD' 02. 335-339 (2002)
Kazuteru Miyazaki:“避免点球利润分享的强化学习及其在足球比赛中的应用”ICONIP 02-SEAL 02-FSKD 02. 335-339 (2002)
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
Kazuteru Miyazaki: "Reinforcement Learning in 2-players Games"Proceedings of the 7th International Symposium on Artificial Life and Robotics. 183-186 (2002)
宫崎一辉:“两人游戏中的强化学习”第七届国际人工生命与机器人研讨会论文集。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
共 6 条
Research on the innovative evolution of deep reinforcement learning based on the profit sharing principle and its application to real problems
-
批准号:21K12024
-
项目类别:Grant-in-Aid for Scientific Research (C)
-
资助金额:$2.75万
-
财政年份:2021
-
负责人:宮崎 和光
-
依托单位:
新たな設計指針に基づく不完全知覚下での強化学習手法の提案と工学的応用に関する研究
-
批准号:15700143
-
项目类别:Grant-in-Aid for Young Scientists (B)
-
资助金额:$1.22万
-
财政年份:2003
-
负责人:宮崎 和光
-
依托单位:
海外基金