Development of inverse reinforcement learning focusing on the multiobjective nature of humans and autonomous systems: towards zero risk and comfort maximization.
Development of inverse reinforcement learning focusing on the multiobjective nature of humans and autonomous systems: towards zero risk and comfort maximization.
批准号:
22H03665
负责人:
荒井 幸代
金额:
$8.32万
依托单位:
依托单位国家:
日本
项目类别:
Grant-in-Aid for Scientific Research (B)
财政年份:
2022
资助国家:
日本
项目状态:
未结题
起止时间:
2022-04-01 至 2025-03-31
中文摘要
本課題は,近い将来,人間の行動範囲に共存する自律機械のうち,ドローン,自動車,鉄道の自律制御るに対す機械学習の導入への信頼(安全性と安心)を担保することを目的としている.今年度は,上記目的に沿った適用可能な機械学習のアルゴリズムの検討と改善,および,学習によって獲得した制御則に基づいた運行(飛行,走行を総じて運行と呼ぶ)軌跡から,制御則の目的関数を推定する方法を検討し,簡易なベンチマークを用いて,方法の妥当性を検証した.ドローンは,既に実用が進む海外の状況から,複数台の飛行状況における協調と競合を想定して,衝突回避しながら,効率よく目的タスクの遂行を実施する深層強化学習アルゴリズムを提案し,計算機シミュレーション実験において良好な結果を得た.鉄道の運行については,定時運行の大前提の下で,鉄道運行における喫緊の課題である省エネルギー運転制御を実現する方法を,二段階最適化問題として定式化した方法のプロトタイプを作成し,従来の方法よりも有意に優れた性能を示すことを確認した.以上は,機械学習によって得られた制御方法によって,タスクの最適性の向上可能性を示唆する成果であるが,併せて,これらの動きに対する,人(設計者や,共存する人々)の反応を検証することも本課題の重要なエッセンスである.これについては,まず,設計者の理解を促す方法として,学習後の制御入力と出力の対応関係を統計的に分析し,入力次元に関して「アテンション」(機械が着目した重要な“特徴”)を抽出することによって,出力との因果関係を導出する方法を検討し,理解の妥当性を評価した.これによって,学習結果のフィルタ効果を確認しており,副次的な効果として,2023年度の研究計画に盛り込む予定である.理解や説明を促すための方法が,学習による制御の冗長な部分や,これまで不可避であった,確率的な挙動解消に対しての有効性が期待できる.
英文摘要
本課題は,近い将来,人間の行動範囲に共存する自律機械のうち,ドローン,自動車,鉄道の自律制御るに対す機械学習の導入への信頼(安全性と安心)を担保することを目的としている.今年度は,上記目的に沿った適用可能な機械学習のアルゴリズムの検討と改善,および,学習によって獲得した制御則に基づいた運行(飛行,走行を総じて運行と呼ぶ)軌跡から,制御則の目的関数を推定する方法を検討し,簡易なベンチマークを用いて,方法の妥当性を検証した.ドローンは,既に実用が進む海外の状況から,複数台の飛行状況における協調と競合を想定して,衝突回避しながら,効率よく目的タスクの遂行を実施する深層強化学習アルゴリズムを提案し,計算機シミュレーション実験において良好な結果を得た.鉄道の運行については,定時運行の大前提の下で,鉄道運行における喫緊の課題である省エネルギー運転制御を実現する方法を,二段階最適化問題として定式化した方法のプロトタイプを作成し,従来の方法よりも有意に優れた性能を示すことを確認した.以上は,機械学習によって得られた制御方法によって,タスクの最適性の向上可能性を示唆する成果であるが,併せて,これらの動きに対する,人(設計者や,共存する人々)の反応を検証することも本課題の重要なエッセンスである.これについては,まず,設計者の理解を促す方法として,学習後の制御入力と出力の対応関係を統計的に分析し,入力次元に関して「アテンション」(機械が着目した重要な“特徴”)を抽出することによって,出力との因果関係を導出する方法を検討し,理解の妥当性を評価した.これによって,学習結果のフィルタ効果を確認しており,副次的な効果として,2023年度の研究計画に盛り込む予定である.理解や説明を促すための方法が,学習による制御の冗長な部分や,これまで不可避であった,確率的な挙動解消に対しての有効性が期待できる.
期刊论文(4)
专著(0)
科研奖励(0)
会议论文
登录
查看更多内容
深層強化学習を用いた自動運転の制御限界の検出
使用深度强化学习检测自动驾驶的控制极限
DOI:
--
发表时间:
2022
期刊:
影响因子:
--
作者:
[岸川 大航, 荒井 幸代, 今村麟太郎,荒井幸代]
通讯作者:
今村麟太郎,荒井幸代
Multi-objective deep inverse reinforcement learning for weight estimation of objectives
用于目标权重估计的多目标深度逆强化学习
DOI:
10.1007/s10015-022-00773-8
发表时间:
2022
期刊:
Artificial Life and Robotics
影响因子:
0.9
作者:
[Takayama Naoya, Arai Sachiyo]
通讯作者:
Arai Sachiyo
DOI:
10.11517/pjsai.jsai2022.0_4e1gs205
发表时间:
2022
期刊:
Proceedings of the Annual Conference of JSAI
影响因子:
--
作者:
[岸川 大航, 荒井 幸代]
通讯作者:
荒井 幸代
強化学習とモデル予測制御を用いた UAV の自律的バッテリー管理による飛行経路最適化
使用强化学习和模型预测控制进行无人机自主电池管理的飞行路径优化
DOI:
--
发表时间:
2022
期刊:
影响因子:
--
作者:
[岸川 大航, 荒井 幸代, 今村麟太郎,荒井幸代, 堀江直人,荒井幸代]
通讯作者:
堀江直人,荒井幸代
人と自律システム系の多目的性に着目した逆強化学習の展開:危険ゼロと快適最大化
-
批准号:23K24921
-
项目类别:Grant-in-Aid for Scientific Research (B)
-
资助金额:$2.33万
-
财政年份:2024
-
负责人:荒井 幸代
-
依托单位: