Confounding-Robust Policy Evaluation in Infinite-Horizon Reinforcement Learning

Confounding-Robust Policy Evaluation in Infinite-Horizon Reinforcement Learning
复制标题

无限视野强化学习中的混杂鲁棒策略评估

DOI:
--
复制
发表时间:
2020
期刊:
Advances in neural information processing systems
影响因子:
--
通讯作者:
Zhou, Angela
Zhou, Angela
中科院分区:
--
文献类型:
--
作者:
Kallus, Nathan;Zhou, Angela

文献摘要

参考文献

被引文献

相似文献

受控马尔可夫链中经验测度和成本的收敛率及瞬态最优性
DOI: 10.1287/moor.19.4.955
发表时间: 1994
期刊: Math. Oper. Res.
影响因子: --
作者:
E. Altman;O. Zeitouni
通讯作者: O. Zeitouni
DOI: --
发表时间: 2018-10
期刊: ArXiv
影响因子: --
作者:
Nathan Kallus;Xiaojie Mao;Angela Zhou
通讯作者: Nathan Kallus;Xiaojie Mao;Angela Zhou
一般政策下马尔可夫决策过程中的经验状态动作频率
DOI: 10.1287/moor.1050.0148
发表时间: 2005
期刊: Math. Oper. Res.
影响因子: --
作者:
Shie Mannor;J. Tsitsiklis
通讯作者: J. Tsitsiklis
马尔可夫决策问题和状态动作频率
DOI: 10.1137/0329043
发表时间: 1991
影响因子: 2.2
作者:
E. Altman;A. Shwartz
通讯作者: A. Shwartz
动态离散选择模型中的二元性
DOI: 10.2139/ssrn.2700773
发表时间: 2015
期刊: Econometrics: Single Equation Models eJournal
影响因子: --
作者:
K. Chiong;Alfred Galichon;M. Shum
通讯作者: M. Shum