Research on the innovative evolution of deep reinforcement learning based on the profit sharing principle and its application to real problems
Research on the innovative evolution of deep reinforcement learning based on the profit sharing principle and its application to real problems
批准号:
21K12024
负责人:
宮崎 和光
金额:
$2.75万
依托单位国家:
日本
项目类别:
Grant-in-Aid for Scientific Research (C)
财政年份:
2021
资助国家:
日本
项目状态:
已结题
起止时间:
2021-04-01 至 2024-03-31
中文摘要
点击翻译按钮获取中文摘要
英文摘要
当該年度においては、これまでに提案してきた利益分配原理(PS原理)に基づく手法を利用した「応用例の探求」を中心に研究を進めた。学術論文「Traffic Signal Control System Using Deep Reinforcement Learning With Emphasis on Reinforcing Successful Experiences」では、信号機制御を題材に、PS原理に基づく手法であるDual Targeting Algorithm(DTA)の有効性を確認した。特に、これまで明らかでなかったDTAのマルチエージェント環境下での有効性を確認できた意義が大きく、応用例探求に関する重要な成果と言える。さらに「Proposal and Evaluation of a Course-Classification-Support System Emphasizing Communication with the Sub-committees Within the Committee of Validation and Examination for Degrees」では、本研究課題で応用例として掲げるカリキュラム分析支援システムの要となる「科目分類支援システム」の研究開発を進めた。加えて、口頭発表「マルチエージェント環境下における強化学習を用いたネガティブツイートの抑制」では、マルチエージェント環境下での間接報酬に関する定理の検証を行い、PS原理に基づく手法が、他手法よりも、ネガティブなツイートを抑制できることを示した。以上より、当該年度では「応用例の探求」を中心に研究を進めるとともに、副目標のひとつである「マルチエージェント環境下での間接報酬との関係を整理し、マルチエージェント環境下でのPS原理の有効性を明らかにする」ことに寄与する成果を得た。
期刊论文(0)
专著(0)
科研奖励(0)
会议论文
登录
查看更多内容
Modeling of placebo effect in stochastic reward tasks by reinforcement learning
通过强化学习对随机奖励任务中的安慰剂效应进行建模
DOI:
10.1016/j.procs.2022.11.064
发表时间:
2022
期刊:
Procedia Computer Science
影响因子:
--
作者:
[Kodama Naoki, Harada Taku, Miyazaki Kazuteru, Miyazaki Kazuteru]
通讯作者:
Miyazaki Kazuteru
Character-level CNN の重みの摂動に関する一考察 - NTCIR-13 MedWeb タスクを題材として -
字符级 CNN 权重扰动研究 - 基于 NTCIR-13 MedWeb 任务 -
DOI:
--
发表时间:
2021
期刊:
影响因子:
--
作者:
[宮崎和光, 井田正明]
通讯作者:
井田正明
Research on the Consistency of Diploma Policies and the Nomenclature of Major Fields of Academic Degrees
文凭政策与专业学位专业命名一致性研究
DOI:
10.1541/ieejeiss.142.117
发表时间:
2022
期刊:
IEEJ Transactions on Electronics, Information and Systems
影响因子:
--
作者:
[宮崎和光, 高橋望, 森利枝]
通讯作者:
森利枝
確率的報酬課題におけるプラセボ効果の強化学習によるモデル化
使用强化学习对随机奖励任务中的安慰剂效应进行建模
DOI:
--
发表时间:
2021
期刊:
影响因子:
--
作者:
[小玉直樹, 宮崎和光, 原田拓, 宮崎和光]
通讯作者:
宮崎和光
NTCIR-13 MedWebタスクを用いたCharacter-level CNNの性能評価
使用 NTCIR-13 MedWeb 任务评估字符级 CNN 的性能
DOI:
--
发表时间:
2021
期刊:
影响因子:
--
作者:
[宮崎和光, 井田正明]
通讯作者:
井田正明
共 28 条
新たな設計指針に基づく不完全知覚下での強化学習手法の提案と工学的応用に関する研究
-
批准号:15700143
-
项目类别:Grant-in-Aid for Young Scientists (B)
-
资助金额:$1.22万
-
财政年份:2003
-
负责人:宮崎 和光
-
依托单位:
強化学習を実問題に応用する際に重要となる報酬および罰の設計指針に関する研究
-
批准号:13780316
-
项目类别:Grant-in-Aid for Young Scientists (B)
-
资助金额:$1.34万
-
财政年份:2001
-
负责人:宮崎 和光
-
依托单位: