Bandit Algorithms Based on Thompson Sampling for Bounded Reward Distributions

Bandit Algorithms Based on Thompson Sampling for Bounded Reward Distributions
复制标题

基于汤普森采样的有界奖励分布的强盗算法

DOI:
--
复制
发表时间:
2019
期刊:
The 31st International Conference on Algorithmic Learning Theory (ALT2020)
影响因子:
--
通讯作者:
Junya Honda
Junya Honda
中科院分区:
--
文献类型:
--
作者:
Charles Riou;Junya Honda

文献摘要

参考文献

被引文献

相似文献

一种新的半有界奖励老虎机算法的非渐近分析
DOI: --
发表时间: 2015
影响因子: 6
作者:
J. Honda;A. Takemura
通讯作者: A. Takemura
顺序分配问题的最优自适应策略
DOI: --
发表时间: 1996
期刊:
影响因子: --
作者:
A. Burnetas;M. Katehakis
通讯作者: M. Katehakis