ロバスト統計を用いた異常値の影響を受けないシステム同定法の構築
ロバスト統計を用いた異常値の影響を受けないシステム同定法の構築
批准号:
19K04448
负责人:
福永 修一
金额:
$2.75万
依托单位国家:
日本
项目类别:
Grant-in-Aid for Scientific Research (C)
财政年份:
2019
资助国家:
日本
项目状态:
已结题
起止时间:
2019-04-01 至 2024-03-31
中文摘要
点击翻译按钮获取中文摘要
英文摘要
本研究では観測に異常値が含まれるデータからシステムを推定するアルゴリズムを開発することが目的である.計画4年目にあたる2022年度は以下の3つの課題に取り組んだ.(1) システム同定のための非線形モデルとして本研究はポートハミルトン系に着目し,ポートハミルトン系のための強化学習法を提案した.強化学習は試行錯誤により報酬を最大化する制御則を獲得するアルゴリズムである.ポートハミルトン系のための強化学習は,未知パラメータを含むポートハミルトン系に対して制御則を学習する方法である.従来提案されていたポートハミルトン系のための強化学習に対して自然勾配法を導入することにより,従来よりも高速に学習が可能なアルゴリズムを提案した.(2) ポートハミルトン系のための強化学習はこれまで確率的方策が用いられてきたが,制御入力に含まれるノイズがシステムの意図しない動作を引き起こす可能性がある.本研究では確率的方策を決定論的方策に置きかえることにより制御入力にノイズが入らないようにし,決定論的方策を勾配法により学習するアルゴリズムを提案した.(3) 強化学習は報酬を最大化するアルゴリズムであるが,実問題を考えると報酬の観測に外れ値が混入する場合がある.外れ値の影響を抑えた推定を行う方法としてベータダイバージェンスを用いたロバスト推定が提案されている.ベータダイバージェンスを用いたロバスト推定は重み関数を用いることにより外れ値の影響を抑えた推定を行うことができる.本研究ではポートハミルトン系のための強化学習において,報酬の観測に外れ値が含まれる問題に対してベータダイバージェンスを用いたロバストなパラメータ更新則を提案した.
期刊论文(16)
专著(0)
科研奖励(0)
会议论文
登录
查看更多内容
ポートハミルトン系のための決定論的方策勾配強化学習法
端口-汉密尔顿系统的确定性策略梯度强化学习方法
DOI:
--
发表时间:
2022
期刊:
影响因子:
--
作者:
[Beck Fabian, Sakamoto Noboru, Ott Christian, 福永修一,小久保燎太]
通讯作者:
福永修一,小久保燎太
ポートハミルトン系のための陰的自然方策勾配強化学習法
汉密尔顿港系统的隐式自然策略梯度强化学习方法
DOI:
--
发表时间:
2021
期刊:
影响因子:
--
作者:
[芦田 樹, 市原 裕之, 福永修一,岩本有生]
通讯作者:
福永修一,岩本有生
ガウス過程回帰の基礎と状態推定への応用
高斯过程回归的基础知识及其在状态估计中的应用
DOI:
--
发表时间:
2020
期刊:
影响因子:
--
作者:
[福永修一]
通讯作者:
福永修一
Robust Privacy Preserving Linear Regression Using Beta-Divergence
使用 Beta 散度的鲁棒隐私保护线性回归
DOI:
10.14923/transfunj.2021jap1023
发表时间:
2022
期刊:
電子電子情報通信学会論文誌A 基礎・境界
影响因子:
--
作者:
[Tsuji Akihiro, Ohashi Asuka, Takaba Kiyotsugu, 竹下虎太朗,福永修一,田中覚,黄緒平]
通讯作者:
竹下虎太朗,福永修一,田中覚,黄緒平
ベータダイバージェンスを用いたポートハミルトン系のためのロバスト自然方策勾配強化学習法
使用 Beta 散度的 Port-Hamilton 系统的鲁棒自然策略梯度强化学习方法
DOI:
--
发表时间:
2022
期刊:
影响因子:
--
作者:
[M. Suzuki, Y. Takizawa and M. Hirata, 福永修一,小久保燎太]
通讯作者:
福永修一,小久保燎太
共 16 条
投薬制御のためのプライバシ保護機能をもつ安全強化学習法の構築
-
批准号:24K07555
-
项目类别:Grant-in-Aid for Scientific Research (C)
-
资助金额:$3.0万
-
财政年份:2024
-
负责人:福永 修一
-
依托单位:
海外基金