Learning reward functions from diverse sources of human feedback: Optimally integrating demonstrations and preferences

Learning reward functions from diverse sources of human feedback: Optimally integrating demonstrations and preferences
复制标题

从不同来源的人类反馈中学习奖励函数:最佳地整合演示和偏好

DOI:
10.1177/02783649211041652
复制
发表时间:
2021
期刊:
The International Journal of Robotics Research
影响因子:
--
通讯作者:
Sadigh, Dorsa
Sadigh, Dorsa
中科院分区:
--
文献类型:
--
作者:
Bıyık, Erdem;Losey, Dylan P.;Palan, Malayandi;Landolfi, Nicholas C.;Shevchuk, Gleb;Sadigh, Dorsa

文献摘要

参考文献

被引文献

相似文献

根据专家偏好学习城市空中交通遭遇模型
DOI: 10.1109/dasc43569.2019.9081648
发表时间: 2019
期刊: 2019 IEEE/AIAA 38th Digital Avionics Systems Conference (DASC)
影响因子: --
作者:
Sydney M. Katz;Anne;Mykel J. Kochenderfer
通讯作者: Mykel J. Kochenderfer
DOI: 10.1109/iros.2011.6094735
发表时间: 2011-12
期刊: 2011 IEEE/RSJ International Conference on Intelligent Robots and Systems
影响因子: --
作者:
M. Cakmak;S. Srinivasa;Min Kyung Lee;J. Forlizzi;S. Kiesler
通讯作者: M. Cakmak;S. Srinivasa;Min Kyung Lee;J. Forlizzi;S. Kiesler
DOI: 10.15607/rss.2019.xv.023
发表时间: 2019-06
期刊: ArXiv
影响因子: --
作者:
Malayandi Palan;Nicholas C. Landolfi;Gleb Shevchuk;Dorsa Sadigh
通讯作者: Malayandi Palan;Nicholas C. Landolfi;Gleb Shevchuk;Dorsa Sadigh
这是我学到的:提出能够奖励学习的问题
DOI: --
发表时间: 2021
影响因子: 5.1
作者:
Soheil Habibian;Ananth Jonnavittula;Dylan P. Losey
通讯作者: Dylan P. Losey
DOI: --
发表时间: 2019-04
期刊: --
影响因子: --
作者:
Daniel S. Brown;Wonjoon Goo;P. Nagarajan;S. Niekum
通讯作者: Daniel S. Brown;Wonjoon Goo;P. Nagarajan;S. Niekum