強化学習における確率的ダイナミクスの表現系とその幾何構造
強化学習における確率的ダイナミクスの表現系とその幾何構造
批准号:
02J03714
负责人:
岩田 一貴
金额:
$1.92万
依托单位:
依托单位国家:
日本
项目类别:
Grant-in-Aid for JSPS Fellows
财政年份:
2002
资助国家:
日本
项目状态:
已结题
起止时间:
2002 至 2004
中文摘要
点击翻译按钮获取中文摘要
英文摘要
今年度は,初めに,複数エージェント強化学習の枠組みがエルゴード的マルコフ決定過程に従い,かつ学習が十分にゆっくり進むという仮定の下で,経験系列(観測された状態,行動,報酬からなる時系列)において漸近等分割性と呼ばれる性質が成り立つことを示した.また,この性質を使って複数エージェントのマルコフ決定過程における収益最大化の解析を行った.この解析は,前年度までの単数エージェントの場合の研究成果を複数エージェントの場合に対して拡張したものである.単散エージェントの場合との違いは,複数のエージェント間の状態把握及び通信に関する制約条件が,複数エージェントの協調政策に深く影響してくる点である.その結果,制約条件は典型集合の大きさ(漸近的に確率1で出現する経験系列の集合)に影響し,その影響は学習が適当に終了する場合において漸近的に消えることを示した.次に,単数エージェントの場合において,強化学習の枠組みに対する標準的な仮定,すなわちマルコフ性,エルゴード性,及び学習が十分にゆっくり進むという仮定を全てなくしてしまっても収益最大化が可能なのかを理論的に検証した.その検証の結果,収益最大化はそれらの仮定をなくしてもある正の確率で可能であり,収益最大化が可能な強化学習の枠組みはエルゴード的マルコフ決定過程より広いクラスの確率過程であることを示した.さらに,収益最大化が可能であるための強化学習の枠組みに対する必要条件を明らかにした.これらの研究成果は,国内の学会及び国際シンポジウム等で発表され,現在は学術雑誌に投稿中である.
期刊论文(10)
专著(0)
科研奖励(0)
会议论文
登录
查看更多内容
The Asymptotic Equipartition Property in Reinforcement Learning and its Relation to Return Maximization
强化学习中的渐近均分性质及其与收益最大化的关系
DOI:
--
发表时间:
期刊:
Neural Networks (発表予定)
影响因子:
--
作者:
[Kazunori Iwata, Kazushi Ikeda, Hideaki Sakai]
通讯作者:
Hideaki Sakai
岩田一貴, 池田和司: "強化学習における収益の情報源符号化とその行動選択への応用"第1回情報科学技術フォーラム講演論文集情報技術レターズ. 111-112 (2002)
Kazuki Iwata、Kazushi Ikeda:“强化学习中收入的来源编码及其在行动选择中的应用”第一届信息科学与技术论坛论文集信息技术快报 111-112 (2002)。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
河本孝生, 岩田一貴, 池田和司, 林和則, 酒井英昭: "EMアルゴリズムを用いた確率的通信路に対する適応等価法"システム制御情報学会論文誌. 17・3. 809-811 (2004)
Takao Kawamoto、Kazuki Iwata、Kazushi Ikeda、Kazunori Hayashi、Hideaki Sakai:“使用 EM 算法的随机通信信道的自适应等效方法”,系统、控制和信息工程师学会汇刊 17・3。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
Kazunori Iwata, Kazushi Ikeda, Hideaki Sakai: "A New Criterion Using Information Gain for Action Selection Strategy in Reinforcement Learning"IEEE Transactions on Neural Networks. 15・3. (2004)
Kazunori Iwata、Kazushi Ikeda、Hideaki Sakai:“强化学习中使用信息增益进行动作选择策略的新标准”IEEE Transactions on Neural Networks(2004 年)。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
On the Effects of Domain Size and Complexity in Empirical Distribution of Reinforcement Learning
关于强化学习经验分布中域大小和复杂性的影响
DOI:
--
发表时间:
2005
期刊:
IEICE Transactions on Information and Systems Vol.E88-D No.1
影响因子:
--
作者:
[Kazunori Iwata, Kazushi Ikeda, Hideaki Sakai]
通讯作者:
Hideaki Sakai
共 10 条
Development of Clustering Methods for Shape Data Using Metric Learning
-
批准号:22K12171
-
项目类别:Grant-in-Aid for Scientific Research (C)
-
资助金额:$1.83万
-
财政年份:2022
-
负责人:岩田 一貴
-
依托单位:
海外基金