Development of Collision Avoidance System for Maritime Autonomous Surface Ship: Imitating and Surpassing Human Experts by Deep Inverse Reinforcement Learning
Development of Collision Avoidance System for Maritime Autonomous Surface Ship: Imitating and Surpassing Human Experts by Deep Inverse Reinforcement Learning
批准号:
22KJ2623
负责人:
檜垣 岳史
金额:
$1.34万
依托单位国家:
日本
项目类别:
Grant-in-Aid for JSPS Fellows
财政年份:
2023
资助国家:
日本
项目状态:
未结题
起止时间:
2023-03-08 至 2025-03-31
中文摘要
点击翻译按钮获取中文摘要
英文摘要
本研究課題では、人間の経験に従って実行される避航操船行動の定量化を図るとともに、熟練船長の感覚に基づく避航航路の獲得に取り組んだ。まず、最大エントロピー逆強化学習を用いて任意の避航航路から最適報酬を導出する手法を提案した。その検証のため、Dangerous Area of Collision (DAC)と呼ばれる衝突危険領域を避けるようなサンプル航路をあらかじめ生成し、その航路を逆強化学習の入力とすることで報酬関数を推定した。推定された報酬分布がDACの形状と良く一致することから、操船の感覚を定量化する手段として最大エントロピー逆強化学習が有効であることを示した。続いて、一般商船の船長経験者の協力のもと、船長による操船シミュレーション実験を実施した。実験で得られた操船航路をエキスパートデータとし報酬関数を導出することで、熟練船長による避航操船の特徴を明らかにした。さらに、得られる報酬が最大となるような経路探索を行うことで熟練船長の感覚に基づく最適航路計画を提案し、今津問題と呼ばれる避航操船のテストシナリオを用いて最適航路計画の有用性を示した。一連の研究成果は日本船舶海洋工学会論文集36巻に掲載されている。他方、研究の遂行にあたり、逆強化学習の適用範囲が小規模かつ離散的な状態空間に限られるという課題に直面した。そこで、強化学習と逆強化学習の2段階最適化問題を1つのミニマックス問題として定式化した敵対的生成模倣学習を導入し、大規模連続状態空間に適用可能な避航航路計画手法を開発した。本年度は、相手船1隻に対する避航航路のサンプルデータが与えられた際、本手法によって所与の航路を精度良く模倣できること確認した。
期刊论文(4)
专著(0)
科研奖励(0)
会议论文
登录
查看更多内容
自動避航操船のための最適航路計画の策定 -逆強化学習による熟練船長の模倣-
制定自动让路机动的最佳航线规划 -使用逆强化学习模仿经验丰富的船长-
DOI:
--
发表时间:
2022
期刊:
影响因子:
--
作者:
[檜垣岳史, 橋本博公, 吉岡舜]
通讯作者:
吉岡舜
敵対的生成模倣学習による避航操船行動の再現
使用生成对抗性模仿学习再现回避操纵行为
DOI:
--
发表时间:
2022
期刊:
影响因子:
--
作者:
[檜垣岳史, 橋本博公]
通讯作者:
橋本博公
Investigation and Imitation of Human Captains' Maneuver Using Inverse Reinforcement Learning
人类船长的考察与模仿
DOI:
10.2534/jjasnaoe.36.137
发表时间:
2022
期刊:
Journal of the Japan Society of Naval Architects and Ocean Engineers
影响因子:
--
作者:
[Higaki Takefumi, Hashimoto Hirotada, Yoshioka Hitoshi]
通讯作者:
Yoshioka Hitoshi
熟練船長による避航操船行動の解明と模倣
由经验丰富的船长讲解和模仿避让动作
DOI:
--
发表时间:
2022
期刊:
影响因子:
--
作者:
[檜垣 岳史, 橋本 博公, 檜垣 岳史]
通讯作者:
檜垣 岳史
海外基金