同型性に基づく抽象化プランニングのロボットの行動学習への応用
同型性に基づく抽象化プランニングのロボットの行動学習への応用
批准号:
07750460
负责人:
山口 智浩
金额:
$0.64万
依托单位:
依托单位国家:
日本
项目类别:
Grant-in-Aid for Encouragement of Young Scientists (A)
财政年份:
1995
资助国家:
日本
项目状态:
已结题
起止时间:
1995 至 --
中文摘要
本年度は、前年度の成果として得られた、状態の同型性を抽象化に利用する“同型性に基づく抽象化問題解決"を拡張し、状態空間の階層的な同型性を利用して、効率的に抽象化問題解決する方法を研究すると共に、一般的な分野への応用として、同型な機能、構造を持つロボットの行動学習として、同型性に基づく抽象化強化学習法を考案し、以下の研究を行った。(1)状態空間の階層的な同型性の解析による、階層化抽象空間の生成同型性に基づく抽象化だけでは不十分な場合、抽象空間の階層的な同型性を利用すると、階層的な抽象空間を段階的に生成して、より小さな抽象空間を求め、解析の計算コストを削減することができることを示した。(2)効率的な抽象化プランニングと詳細化生成した階層的な抽象空間中に、初期状態と目標状態とを写像し、抽象空間における、初期状態と目標状態とを結ぶ状態遷移をプランニングにより求めて、抽象プランを効率よく探索できることを示した。(3)ロボットの行動学習システムの構築現有の計算機と通信しながら学習するロボットの行動学習システムを構築した。シミュレーション学習と実環境での実ロボットとのハイブリッド強化学習システムを作成し、両者の学習システムを共通化することにより、仮想個体、実ロボット間での学習結果の交換を可能とした。学習法として、経験強化型のClassifier Systemを元にして、高速化の拡張を行い、従来困難だった実ロボットでの実時間強化学習を実現した。(4)同型性に基づく強化学習法による、ロボットの多様な行動の獲得構築したロボットの行動学習システムを用いて、まずあるタスクで強化学習を行い、得た学習結果に対し、行為の同型性を利用した置換を組み合わせ的に施して同型な学習結果を生成し、学習結果のバリエーションの探索を行う。その結果、学習したタスクを達成する、同型な挙動や、学習タスクに似た、類似挙動など、従来の強化学習法では、得られない多様な行動を、効率的に獲得することができた。
英文摘要
本年度は、前年度の成果として得られた、状態の同型性を抽象化に利用する“同型性に基づく抽象化問題解決"を拡張し、状態空間の階層的な同型性を利用して、効率的に抽象化問題解決する方法を研究すると共に、一般的な分野への応用として、同型な機能、構造を持つロボットの行動学習として、同型性に基づく抽象化強化学習法を考案し、以下の研究を行った。(1)状態空間の階層的な同型性の解析による、階層化抽象空間の生成同型性に基づく抽象化だけでは不十分な場合、抽象空間の階層的な同型性を利用すると、階層的な抽象空間を段階的に生成して、より小さな抽象空間を求め、解析の計算コストを削減することができることを示した。(2)効率的な抽象化プランニングと詳細化生成した階層的な抽象空間中に、初期状態と目標状態とを写像し、抽象空間における、初期状態と目標状態とを結ぶ状態遷移をプランニングにより求めて、抽象プランを効率よく探索できることを示した。(3)ロボットの行動学習システムの構築現有の計算機と通信しながら学習するロボットの行動学習システムを構築した。シミュレーション学習と実環境での実ロボットとのハイブリッド強化学習システムを作成し、両者の学習システムを共通化することにより、仮想個体、実ロボット間での学習結果の交換を可能とした。学習法として、経験強化型のClassifier Systemを元にして、高速化の拡張を行い、従来困難だった実ロボットでの実時間強化学習を実現した。(4)同型性に基づく強化学習法による、ロボットの多様な行動の獲得構築したロボットの行動学習システムを用いて、まずあるタスクで強化学習を行い、得た学習結果に対し、行為の同型性を利用した置換を組み合わせ的に施して同型な学習結果を生成し、学習結果のバリエーションの探索を行う。その結果、学習したタスクを達成する、同型な挙動や、学習タスクに似た、類似挙動など、従来の強化学習法では、得られない多様な行動を、効率的に獲得することができた。
期刊论文(5)
专著(0)
科研奖励(0)
会议论文
登录
查看更多内容
Tomohiro Yamaguchi: "Propagating Leamed Behaviors from a Virtual Agent to a Physical Robot in Reinforcement Learning" Proc.of IEEE Int.Conf.on Evolutionary Computation(ICEC-96)at Nagoya,(accepted). (1996)
Tomohiro Yamaguchi:“在强化学习中将学习行为从虚拟代理传播到物理机器人”Proc.of IEEE Int.Conf.on Evolutionary Computation(ICEC-96),名古屋,(已接受)。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
Tomohiro Yamaguchi: "Learning Cooperative Behaviors with Spontaneous Mimetism" Proc.of 6th Int.Fuzzy Systems Association World Congress(IFSA-95). Vol.1. 101-104 (1995)
Tomohiro Yamaguchi:“通过自发模仿学习合作行为”第六届国际模糊系统协会世界大会(IFSA-95)的会议记录。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
Tomohiro Yamaguchi: "Multi-agent Reinforcement Learning with Adaptive Mimetism" Proc.of 5th Int.Workshop on Artificial Life(ALife V)1996 at Nara,ATR,(poster accepted). (1996)
Tomohiro Yamaguchi:“自适应模仿的多智能体强化学习”Proc.of 5th Int.Workshop on Artificial Life(ALife V)1996,奈良,ATR,(已接受海报)。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
田中康祐: "実ロボットとシミュレータ・エージェントとの協調による行動学習システム" 第13回ロボット学会学術講演会. No.1. 457-458 (1995)
Kosuke Tanaka:“基于真实机器人和模拟器代理之间合作的动作学习系统”日本机器人学会第 13 届年会第 1. 457-458 号(1995 年)。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
増渕元臣: "ロボットにおけるドリブル動作の実環境下での強化学習" 第13回ロボット学会学術講演会. No.1. 459-460 (1996)
Motoomi Masubuchi:“真实环境中机器人运球的强化学习”,日本机器人学会第 13 届年会,第 1. 459-460 号(1996 年)。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
ロボットにおける心の機能の実現:メンタルシミュレーションを併用したロボット学習の高速化
-
批准号:10780232
-
项目类别:Grant-in-Aid for Encouragement of Young Scientists (A)
-
资助金额:$1.22万
-
财政年份:1998
-
负责人:山口 智浩
-
依托单位:
同型性に基づく抽象化問題解決
-
批准号:06750420
-
项目类别:Grant-in-Aid for Encouragement of Young Scientists (A)
-
资助金额:$0.58万
-
财政年份:1994
-
负责人:山口 智浩
-
依托单位:
海外基金