课题基金 / 基金详情

学習時間を1/10にした学習手法の拡張によるロボット向けエッジAIの構築と評価

学習時間を1/10にした学習手法の拡張によるロボット向けエッジAIの構築と評価
通过扩展学习方法构建和评估机器人边缘AI,将学习时间减少到1/10
批准号:
20K11943
负责人:
小谷 直樹
金额:
$2.75万
依托单位国家:
日本
项目类别:
Grant-in-Aid for Scientific Research (C)
财政年份:
2020
资助国家:
日本
项目状态:
已结题
起止时间:
2020-04-01 至 2024-03-31

项目摘要

项目成果

小谷 直樹的其他基金

相似基金

相关文献

中文摘要
翻译
令和4年度は,連続状態行動空間を扱う強化学習エージェントの学習過程において,途中で学習が不安定化し,タスクの成功率が低下する問題の抑制と心理学に基づく学習効率の改善方法について研究を行った.また,昨年度に引き続き,AHPを用いた報酬設計の工夫による学習解の質の改善について検証した.具体的には,学習が不安定化する問題に対しては,連続状態行動空間を自律的に離散化しながら政策を学習する場合,遷移先の状態が1ステップ前の離散状態と同じ状態と判別する場合がある.この時,td誤差を計算すると,割引率があることから負の値になり,行動の評価が下がるため,収束していた政策を広げるように更新する.この理由により行動が不安定になる.特に,1ステップ当たりのエージェントの動作時間が短くなると,この影響が大きくなる.この問題を軽減することでタスクの成功率の低下を抑制した.次に,心理学において,複数のタスクを同時並行的に学習する方法がある.この仕組みをマルチタスクを扱う強化学習エージェントに適用することで,学習効率を高めることができるかをロボットを用いた学習実験によって検証した.AHPを用いた報酬設計については,迷路問題を扱う強化学習エージェントを用いてその効果を検証した.10×10の迷路問題に対して,ゴールへ到達することに加えて,より少ないステップ数で到達することを報酬として表現し学習した結果,ステップ数を評価に加えることによってゴール到達に要するステップ数が小さくなることを確認した.以上の研究に関して,学会で2件の口頭発表を行った.
英文摘要
令和4年度は,連続状態行動空間を扱う強化学習エージェントの学習過程において,途中で学習が不安定化し,タスクの成功率が低下する問題の抑制と心理学に基づく学習効率の改善方法について研究を行った.また,昨年度に引き続き,AHPを用いた報酬設計の工夫による学習解の質の改善について検証した.具体的には,学習が不安定化する問題に対しては,連続状態行動空間を自律的に離散化しながら政策を学習する場合,遷移先の状態が1ステップ前の離散状態と同じ状態と判別する場合がある.この時,td誤差を計算すると,割引率があることから負の値になり,行動の評価が下がるため,収束していた政策を広げるように更新する.この理由により行動が不安定になる.特に,1ステップ当たりのエージェントの動作時間が短くなると,この影響が大きくなる.この問題を軽減することでタスクの成功率の低下を抑制した.次に,心理学において,複数のタスクを同時並行的に学習する方法がある.この仕組みをマルチタスクを扱う強化学習エージェントに適用することで,学習効率を高めることができるかをロボットを用いた学習実験によって検証した.AHPを用いた報酬設計については,迷路問題を扱う強化学習エージェントを用いてその効果を検証した.10×10の迷路問題に対して,ゴールへ到達することに加えて,より少ないステップ数で到達することを報酬として表現し学習した結果,ステップ数を評価に加えることによってゴール到達に要するステップ数が小さくなることを確認した.以上の研究に関して,学会で2件の口頭発表を行った.
期刊论文(5)
专著(0)
科研奖励(0)
会议论文
転移学習を用いた高次元状態空間での強化学習の高速化の検討
利用迁移学习加速高维状态空间强化学习的研究
DOI: --
发表时间: 2020
期刊:
影响因子: --
作者: [Koutarou Matsumoto, Yasunobu Nohara, Mikako Sakaguchi, Yohei Takayama, Hidehisa Soejima and Naoki Nakashima, 小谷直樹]
通讯作者: 小谷直樹
Reduction of Learning Time for Differential-Wheeled Mobile Robots by Knowledge Transfer for Real-Time Learning
通过实时学习的知识转移减少差动轮式移动机器人的学习时间
DOI: 10.5687/iscie.33.317
发表时间: 2020
期刊: Transactions of the Institute of Systems, Control and Information Engineers
影响因子: --
作者: [相川渉, 三輪誠, 佐々木裕, Y.Kato and T.Saeki, 藤田浩輝,有吉雄哉,吉村康広,小川泰信,花田俊也, Kotani Naoki]
通讯作者: Kotani Naoki
ロボット強化学習のための学習安定化の一手法
一种机器人强化学习的学习稳定方法
DOI: --
发表时间: 2022
期刊:
影响因子: --
作者: [Ryuichiro Higashinaka, Takashi Minato, Kurima Sakai, Tomo Funayama, Hiromitsu Nishizaki, Takayuki Nagai, 小谷直樹]
通讯作者: 小谷直樹
階層意思決定法を用いた強化学習の報酬設計
使用分层决策方法进行强化学习的奖励设计
DOI: --
发表时间: 2023
期刊:
影响因子: --
作者: [Yamaguchi Tomohiro, Kawabuchi Yuto, Takahashi Shota, Ichikawa Yoshihiro, Takadama Keiki, 根来 陸也,小谷 直樹]
通讯作者: 根来 陸也,小谷 直樹
遺伝子工学に基づく肺保護タンパクを用いた新しい急性肺障害治療法の開発
  • 批准号:
    17390424
  • 项目类别:
    Grant-in-Aid for Scientific Research (B)
  • 资助金额:
    $8.32万
  • 财政年份:
    2005
  • 负责人:
    小谷 直樹
  • 依托单位:
全身麻酔時における肺胞マクロファージ炎症反応の分子生物学的研究
  • 批准号:
    05771108
  • 项目类别:
    Grant-in-Aid for Encouragement of Young Scientists (A)
  • 资助金额:
    $0.58万
  • 财政年份:
    1993
  • 负责人:
    小谷 直樹
  • 依托单位:
海外基金