Deterministic Policy Search Method for Real Robot Control

Deterministic Policy Search Method for Real Robot Control
复制标题

DOI:
10.3902/jnns.24.195
复制
发表时间:
2017
期刊:
The Brain & Neural Networks
影响因子:
--
通讯作者:
E. Uchibe;Jiexin Wang
E. Uchibe;Jiexin Wang
中科院分区:
其他
文献类型:
--
作者:
E. Uchibe;Jiexin Wang

文献摘要

相似文献

概要 強化学習で用いられる確率的方策は各時刻で行動を確率的に決定するため,生成される軌道 が滑らかでなく実ロボットの行動学習には適さない.また,方策の改善に用いる方策勾配の 推定値が大きな分散を持ち,学習過程を安定化させるためには一つの確率的方策を複数回評 価する必要がある.このため,ロボット制御に適した決定論的方策を Policy Gradients with Parameter-based Exploration(PGPE)は状態行動空間で探査するのではなく,方策パラメー タ空間で探査するように強化学習の目的を再構成することで,決定論的方策を学習することを 可能にした.しかし PGPEは勾配法に基づく方法であり,学習率の調整を必要とした.本解 説では学習率の調節の必要のない,EMアルゴリズムを用いた決定論的方策を学習するための 手法を説明する.スマートフォンをベースにした倒立二輪型移動ロボットを用いた複数の実験 において,決定論的方策を用いることの利点や提案手法が実ロボットの学習に有効であること を述べる.