Reward-Weighted Regression with Sample Reuse for Direct Policy Search in Reinforcement Learning
Reward-Weighted Regression with Sample Reuse for Direct Policy Search in Reinforcement Learning
复制标题
DOI:
10.1162/neco_a_00199
复制
发表时间:
2011-11
影响因子:
2.9
通讯作者:
Hirotaka Hachiya;Jan Peters;Masashi Sugiyama
中科院分区:
文献类型:
--
作者:
Hirotaka Hachiya;Jan Peters;Masashi Sugiyama
Abstract Direct policy search is a promising reinforcement learning framework, in particular for controlling continuous, high-dimensional systems. Policy search often requires a large number of samples for obtaining a stable policy update estimator, and this is prohibitive when the sampling cost is expensive. In this letter, we extend an expectation-maximization-based policy search method so that previously collected samples can be efficiently reused. The usefulness of the proposed method, reward-weighted regression with sample reuse (R), is demonstrated through robot learning experiments. (This letter is an extended version of our earlier conference paper: Hachiya, Peters, & Sugiyama, 2009.)