Stochastic Contextual Bandits with Long Horizon Rewards

Stochastic Contextual Bandits with Long Horizon Rewards
复制标题

具有长期奖励的随机上下文强盗

DOI:
--
复制
发表时间:
2023
期刊:
Proceedings of the AAAI Conference on Artificial Intelligence
影响因子:
--
通讯作者:
Oymak, Samet
Oymak, Samet
中科院分区:
--
文献类型:
--
作者:
Qin, Yuzhen;Li, Yingcong;Pasqualetti, Fabio;Fazel, Maryam;Oymak, Samet

文献摘要

参考文献

被引文献

相似文献

非随机线性强盗中的延迟与合作
DOI: 10.1051/0004-6361/202345845
发表时间: 2020
期刊: Astronomy & Astrophysics
影响因子: --
作者:
Shinji Ito;Daisuke Hatano;Hanna Sumita;Kei Takemura;Takuro Fukunaga;Naonori Kakimura;K. Kawarabayashi
通讯作者: K. Kawarabayashi
DOI: --
发表时间: 2017-09
期刊: --
影响因子: --
作者:
Ciara Pike-Burke;Shipra Agrawal;Csaba Szepesvari;S. Grünewälder
通讯作者: Ciara Pike-Burke;Shipra Agrawal;Csaba Szepesvari;S. Grünewälder
DOI: --
发表时间: 2020-02
期刊: arXiv: Learning
影响因子: --
作者:
Guanya Shi;Yiheng Lin;Soon-Jo Chung;Yisong Yue;A. Wierman
通讯作者: Guanya Shi;Yiheng Lin;Soon-Jo Chung;Yisong Yue;A. Wierman
具有聚合反馈的高斯过程强盗
DOI: 10.1609/aaai.v36i8.20892
发表时间: 2021
期刊: ArXiv
影响因子: --
作者:
Mengyan Zhang;Russell Tsuchida;Cheng Soon Ong
通讯作者: Cheng Soon Ong
稀疏线性老虎机的信息定向采样
DOI: --
发表时间: 2021
期刊: Neural Information Processing Systems
影响因子: --
作者:
Botao Hao;Tor Lattimore;Wei Deng
通讯作者: Wei Deng