深層強化学習で非線形な制御が学習できるか~物理演算ゲームの学習を通じた検証~
深層強化学習で非線形な制御が学習できるか~物理演算ゲームの学習を通じた検証~
批准号:
18H00543
负责人:
松木 俊貴
金额:
$0.33万
依托单位:
依托单位国家:
日本
项目类别:
Grant-in-Aid for Encouragement of Scientists
财政年份:
2018
资助国家:
日本
项目状态:
已结题
起止时间:
2018 至 --
中文摘要
点击翻译按钮获取中文摘要
英文摘要
本研究では, 「目標軌道」ではなく, 報酬を最大化するという「目的」に基づいた制御則学習の実現可能性について調査するため, 物理演算ゲームタスクを深層強化学習によって学習させて検証を行った.エージェントが学習するタスクとして, ボードをうまく傾けることによりボード上の球をゴールへと導くRoll-a-Ballと呼ばれるゲームを用いた. ボード上には落とし穴がランダムに出現し, 落ちるとエージェントには罰が与えられ, うまく避けながらゴールすると報酬が与えられる. このタスクではランダムに位置が変わる落とし穴の存在により事前に決まった軌道を生成することができず, また, 壁に衝突した際のバウンドなども考慮しつつ非線形に傾斜角を変えていく必要があることから, 本課題における制御則学習のタスクとして設定した. 上記のようなタスクに対し, エージェントの状態を入力としボードの傾斜角を出力とするニューラルネットワーク(NN)をActor-Criticと呼ばれる手法で学習した. タスク環境の非線形なダイナミクスの中で情報を処理し操作量を出力するためにリカレントニューラルネットワーク(RNN)と呼ばれる再帰構造を持つNNを用いた. さらに本研究では時間を遡る学習処理を伴わないため, 高速かつ安定的に学習ができ, パターン生成などの研究にも使われることの多いリザバネットワーク(RN)と呼ばれる特殊なRNNを中間層に導入した多層のNNを用いた.当初の計画では環境の画像を直接NNに与えて学習を行う予定であったが, 上層から伝播してきた誤差信号をRNより下層へ伝播させて学習することが困難であった. しかし, RNに画像のような高次元の入力を直接与えることはできないため, 球, ゴール, 落とし穴などの座標, 相対速度, 相対距離, 相対角度といった事前処理済みの入力に切り替えて学習したところ学習に成功した. 今後, 下層の学習を実現する方法を検討することが課題として残った.
期刊论文(0)
专著(0)
科研奖励(0)
会议论文
深層強化学習技術の導入によるカオスベース強化学習の性能向上
-
批准号:22K17969
-
项目类别:Grant-in-Aid for Early-Career Scientists
-
资助金额:$2.91万
-
财政年份:2022
-
负责人:松木 俊貴
-
依托单位:
Deep LearningとKinectセンサによる手話認識システムの開発
-
批准号:17H00380
-
项目类别:Grant-in-Aid for Encouragement of Scientists
-
资助金额:$0.35万
-
财政年份:2017
-
负责人:松木 俊貴
-
依托单位:
聴覚障害者福祉の向上を目指したDeep Learning手話認識システムの開発
-
批准号:16H00392
-
项目类别:Grant-in-Aid for Encouragement of Scientists
-
资助金额:$0.35万
-
财政年份:2016
-
负责人:松木 俊貴
-
依托单位:
海外基金