Dyna-AIL : Adversarial Imitation Learning by Planning

Dyna-AIL : Adversarial Imitation Learning by Planning
复制标题

DOI:
--
复制
发表时间:
2019-03
期刊:
ArXiv
影响因子:
--
通讯作者:
Vaibhav Saxena;Srinivasan Sivanandan;Pulkit Mathur
Vaibhav Saxena;Srinivasan Sivanandan;Pulkit Mathur
中科院分区:
其他
文献类型:
--
作者:
Vaibhav Saxena;Srinivasan Sivanandan;Pulkit Mathur

文献摘要

被引文献

相似文献

对抗性模仿学习方法已被证明在各种控制任务中表现良好。然而,它们需要大量的环境交互才能收敛。在本文中,我们提出了一种端到端可微的对抗模仿学习算法,用于在基于模型的规划和基于专家数据的无模型学习之间切换。我们在离散和连续环境上的结果表明,与最先进的学习方法相比,我们使用基于模型的规划和无模型学习的方法收敛到一个最优策略,其环境交互数量更少。
Adversarial methods for imitation learning have been shown to perform well on various control tasks. However, they require a large number of environment interactions for convergence. In this paper, we propose an end-to-end differentiable adversarial imitation learning algorithm in a Dyna-like framework for switching between model-based planning and model-free learning from expert data. Our results on both discrete and continuous environments show that our approach of using model-based planning along with model-free learning converges to an optimal policy with fewer number of environment interactions in comparison to the state-of-the-art learning methods.