制約充足確率に基づく強化学習による組合せ最適化問題の解法に関する基礎的研究
制約充足確率に基づく強化学習による組合せ最適化問題の解法に関する基礎的研究
批准号:
22K12158
负责人:
松井 藤五郎
金额:
$2.66万
依托单位:
依托单位国家:
日本
项目类别:
Grant-in-Aid for Scientific Research (C)
财政年份:
2022
资助国家:
日本
项目状态:
未结题
起止时间:
2022-04-01 至 2025-03-31
中文摘要
点击翻译按钮获取中文摘要
英文摘要
2022年度は、深層強化学習を実際の物流業務における配送時間制約付き配車計画問題に適用するための準備として、巡回セールスマン問題 (TSP) を深層強化学習を用いて解く手法おける報酬の改善方法について検討した。また、制約充足確率に拡張する予定である成功確率に基づく安全な強化学習の手法を深層強化学習に拡張する方法について検討した。実際の物流業務においては、複数の配送先が非常に近い位置にあることがある。配送先が離れている場合には経路を変更すると経路長が大きく変わるが、配送先が非常に近い位置にある場合には経路を変更しても経路長がほとんど変わらない。先行研究において提案された最短経路長を新しく作成した経路長の差分(改善分)を報酬とする手法においては、このような問題に対しては報酬が非常に小さくなり、学習が進まなくなってしまう。そこで本研究では、平方根を用いた報酬関数を導入することによって、1より小さい報酬を増加させるとともに1より大きい報酬を減少させる方法を開発した。この手法を実際の運送会社の配送経路探索問題に適用し、配送先が非常に近い位置に密集している問題において有効であることを確認した。この成果については、2023年6月に熊本で開催される2023年度人工知能学会全国大会(第37回)において発表する予定である。また、我々がこれまでに開発した成功確率に基づく安全な強化学習の手法 EQ を深層強化学習の手法である DQN をベースとして Variable Autoencoder (VAE) を用いて成功し続ける確率を推定する手法 DEQN に拡張した。この成果については、2022年度6月に京都で開催された2022年度人工知能学会全国大会(第36回)において発表した。
期刊论文(2)
专著(0)
科研奖励(0)
会议论文
DQNに基づく連続観測空間における安全な強化学習
基于DQN的连续观察空间安全强化学习
DOI:
--
发表时间:
2022
期刊:
影响因子:
--
作者:
[大橋 宥斗, 松井 藤五郎, 武藤 敦子, 森山 甲一, 犬塚 信博]
通讯作者:
犬塚 信博
組合せ最適化におけるジャンピングとアテンションを用いたグラフニューラルネットワーク
在组合优化中使用跳跃和注意力的图神经网络
DOI:
--
发表时间:
2022
期刊:
影响因子:
--
作者:
[グェンフウ バオロン, 松井 藤五郎, 原 謙介]
通讯作者:
原 謙介
ファイナンスにおける時系列解析のための強化学習に関する基礎的研究
-
批准号:21700175
-
项目类别:Grant-in-Aid for Young Scientists (B)
-
资助金额:$0.42万
-
财政年份:2009
-
负责人:松井 藤五郎
-
依托单位: