One Policy is Enough: Parallel Exploration with a Single Policy is Near-Optimal for Reward-Free Reinforcement Learning
One Policy is Enough: Parallel Exploration with a Single Policy is Near-Optimal for Reward-Free Reinforcement Learning
复制标题
一项策略就足够了:使用单一策略的并行探索对于无奖励强化学习来说是近乎最优的
DOI:
--
复制
发表时间:
2023
期刊:
影响因子:
--
通讯作者:
Kolar, Mlanden
中科院分区:
文献类型:
--
作者:
Cisneros-Velarde, Pedro;Lyu, Boxiang;Koyejo, Sanmi;Kolar, Mlanden