课题基金 / 基金详情

Development of Asynchronous Distributed Multi-module Deep Reinforcement Learning Focusing on Different Control Periods

Development of Asynchronous Distributed Multi-module Deep Reinforcement Learning Focusing on Different Control Periods
关注不同控制周期的异步分布式多模块深度强化学习的发展
批准号:
21H03527
负责人:
内部 英治
金额:
$10.73万
依托单位国家:
日本
项目类别:
Grant-in-Aid for Scientific Research (B)
财政年份:
2021
资助国家:
日本
项目状态:
未结题
起止时间:
2021-04-01 至 2025-03-31

项目摘要

项目成果

内部 英治的其他基金

相关文献

中文摘要
翻译
本年度は主にモデルフリー強化学習とモデルベース強化学習を協調学習させるための基準について調査した。これまでは各学習器の価値関数の大小に応じて確率的に学習器を選択する「価値関数に基づく方法」のみを用いてきた。本年度はそれに加えて、「報酬予測誤差に基づく方法」、「状態予測誤差に基づく方法」、およびそれらの重みづけで表現された選択強度を学習する「学習に基づく方法」を実装し、比較検討した。モデルフリー強化学習はDeep Deterministic Policy Gradientを、モデルベース強化学習はStochastic Value Gradientを、「学習に基づく方法」ではREINFORCEをアルゴリズムとして採用した。また評価方法としてはOpenAI Gymで提供されるFetchReach、FeatchSlide、FetchPickAndPlaceを用いた。もっとも簡単なFetchReach課題では「価値関数に基づく方法」と「学習に基づく方法」は学習が進むにつれてモデルフリーを選択する確率が増大し、「状態予測誤差に基づく方法」ではモデルベースを選択する確率が増加する傾向がみられた。FetchReachよりも複雑なFetchSlideでは「価値関数に基づく方法」と「状態予測誤差に基づく方法」の両方でモデルフリーを選択する確率が支配的となった。FetchPickAndPlaceでは、「価値関数に基づく方法」は学習中期ではモデルベースを、学習後期ではモデルフリーを選ぶ傾向があり、これまでの研究結果を支持する結果が得られた。またすべての実験において、報酬予測誤差に基づく方法」では学習器の選択について、進捗状況に関連した傾向はみられなかった。
英文摘要
本年度は主にモデルフリー強化学習とモデルベース強化学習を協調学習させるための基準について調査した。これまでは各学習器の価値関数の大小に応じて確率的に学習器を選択する「価値関数に基づく方法」のみを用いてきた。本年度はそれに加えて、「報酬予測誤差に基づく方法」、「状態予測誤差に基づく方法」、およびそれらの重みづけで表現された選択強度を学習する「学習に基づく方法」を実装し、比較検討した。モデルフリー強化学習はDeep Deterministic Policy Gradientを、モデルベース強化学習はStochastic Value Gradientを、「学習に基づく方法」ではREINFORCEをアルゴリズムとして採用した。また評価方法としてはOpenAI Gymで提供されるFetchReach、FeatchSlide、FetchPickAndPlaceを用いた。もっとも簡単なFetchReach課題では「価値関数に基づく方法」と「学習に基づく方法」は学習が進むにつれてモデルフリーを選択する確率が増大し、「状態予測誤差に基づく方法」ではモデルベースを選択する確率が増加する傾向がみられた。FetchReachよりも複雑なFetchSlideでは「価値関数に基づく方法」と「状態予測誤差に基づく方法」の両方でモデルフリーを選択する確率が支配的となった。FetchPickAndPlaceでは、「価値関数に基づく方法」は学習中期ではモデルベースを、学習後期ではモデルフリーを選ぶ傾向があり、これまでの研究結果を支持する結果が得られた。またすべての実験において、報酬予測誤差に基づく方法」では学習器の選択について、進捗状況に関連した傾向はみられなかった。
期刊论文(1)
专著(0)
科研奖励(0)
会议论文
深層並列強化学習
深度并行强化学习
DOI: --
发表时间: 2021
期刊:
影响因子: --
作者: [五月女絢音, 金井 理, 伊達宏昭, 遠藤維, 川西康友, 大森敏明, 内部英治]
通讯作者: 内部英治
遅延を考慮した非同期分散型マルチモジュール・タイムスケール深層強化学習の開発