课题基金 / 基金详情

新たな設計指針に基づく不完全知覚下での強化学習手法の提案と工学的応用に関する研究

新たな設計指針に基づく不完全知覚下での強化学習手法の提案と工学的応用に関する研究
基于新设计准则的不完全感知下强化学习方法的提出及工程应用研究
批准号:
15700143
负责人:
宮崎 和光
金额:
$1.22万
依托单位国家:
日本
项目类别:
Grant-in-Aid for Young Scientists (B)
财政年份:
2003
资助国家:
日本
项目状态:
已结题
起止时间:
2003 至 2004

项目摘要

项目成果

宮崎 和光的其他基金

相似基金

相关文献

中文摘要
翻译
点击翻译按钮获取中文摘要
英文摘要
本年度においては、まず初めに、複数種類の報酬と罰が存在する環境を対象に、それらの間の優先順位を考慮した強化学習システムの提案を行った。これは、これまで研究代表者が主張してきた「報酬と罰に値を設定することなく、直接、罰の回避と報酬の獲得を目指す」という設計指針に合致した手法を、「報酬と罰の間の優先順位」という観点から捉え直すことで得られた。これにより、従来、不適切な取り扱いがなされる可能性のあった複数種類の報酬と罰が存在する環境を適切に取り扱うことが可能となった。その後、さらにこの考えを、昨年度提案したPS-r*に適用した。これにより当初の研究目的である、「不完全知覚環境を対象とする強化学習システムにおける複数種類の報酬および罰の取り扱い方法に関する指針」、すなわち、「報酬と罰に値を設定する必要はなく、それらの間の優先順位を与えればよい」を得ることができた。現在、強化学習システムは、報酬と罰に値を設定し、それらの値を元に学習システムの評価関数を更新するものが主流となっている。しかしながら、そのようなシステムを実問題に応用する際には、報酬および罰をどのように設計するかが非常に重要な問題となる。本研究課題では、これまでの報酬と罰を一軸で評価することの問題点を指摘するとともに、報酬と罰の間の優先順位に着目した新たな設計指針、ならびに、その指針に合致した強化学習システムを提案している点に大きな意味がある。これにより、強化学習の実問題への応用を強く後押しするものと考える。本研究課題では、具体的なテストベットとしてサッカーサーバを想定し実験環境の整備を行ってきた。サッカーサーバについては、先に行った予備的実験を踏まえ、現在、大規模な実験を行う準備をしている最中である。また、その他、オセロゲーム等の対戦型のゲーム問題を複数種類の報酬と罰が存在する不完全知覚問題として定式化し、提案手法の有効性の検証に利用することも現在検討している。
期刊论文(5)
专著(0)
科研奖励(0)
会议论文
Miyazaki, K.: "Generating Cooperative Behavior by Multi-Agent Profit Sharing on the Soccer Game"Proc.Of the 4th International Symposium on Advanced Intelligent Systems. 166-169 (2003)
Miyazaki, K.:“在足球比赛中通过多智能体利润共享生成合作行为”第四届高级智能系统国际研讨会的会议记录。
DOI: --
发表时间:
期刊:
影响因子: --
作者: []
通讯作者:
複数種類の報酬と罰が存在する環境下への罰回避政策形成アルゴリズムの拡張
将惩罚避免策略形成算法扩展到存在多种奖励和惩罚的环境
DOI: --
发表时间: 2004
期刊: SSI2004(計測自動制御学会 システム・情報部門学術講演会)
影响因子: --
作者: [Miyazaki, K., 宮崎和光]
通讯作者: 宮崎和光
宮崎和光: "Profit Sharingの不完全知覚環境下への拡張:PS-r*の提案と評価"人工知能学会論文誌. 18・5. 286-296 (2003)
宫崎一光:“将利润分享扩展到不完全感知环境:PS-r*的提议和评估”人工智能学会杂志18・5(2003)。
DOI: --
发表时间:
期刊:
影响因子: --
作者: []
通讯作者:
DOI: --
发表时间: 2004
期刊: Proc of the 5th International Symposium on Advanced Intelligent Systems (CD-ROM)
影响因子: --
作者: [Miyazaki, K.]
通讯作者: K.
Research on the innovative evolution of deep reinforcement learning based on the profit sharing principle and its application to real problems
強化学習を実問題に応用する際に重要となる報酬および罰の設計指針に関する研究
海外基金