Approximate Policy Iteration with a Policy Language Bias

Approximate Policy Iteration with a Policy Language Bias
复制标题

具有策略语言偏差的近似策略迭代

DOI:
--
复制
发表时间:
2003
期刊:
Neural Information Processing Systems
影响因子:
--
通讯作者:
R. Givan
R. Givan
中科院分区:
--
文献类型:
--
作者:
Alan Fern;S. Yoon;R. Givan

文献摘要

被引文献

相似文献

我们探索了近似策略迭代,用策略空间中的学习步骤取代了通常的代价函数学习步骤。我们给出了策略语言偏差,使非常大的关系马尔可夫决策过程(MDP)的解成为可能,这是以前任何技术都不能解决的。特别是,我们通过求解极大的MDP等领域,为经典的规划领域(包括确定性和随机变量)归纳出高质量的领域特定规划者。
We explore approximate policy iteration, replacing the usual cost-function learning step with a learning step in policy space. We give policy-language biases that enable solution of very large relational Markov decision processes (MDPs) that no previous technique can solve. In particular, we induce high-quality domain-specific planners for classical planning domains (both deterministic and stochastic variants) by solving such domains as extremely large MDPs.