课题基金 / 基金详情

基于智能演进的服务机器人技能学习研究

批准号:
62103009
项目类别:
青年科学基金项目(C类)
资助金额:
30.0 万元
负责人:
朱晓庆
依托单位:
学科分类:
机器人学与智能系统
结题年份:
2024
批准年份:
2021
项目状态:
已结题
项目参与者:
朱晓庆

项目摘要

结项摘要

相似基金

相关文献

中文摘要
机器人技能水平是机器人智能化程度的重要标志,是国民经济和科技发展水平的典型指标。针对预设固定控制程序参数不能完成技能学习过程不足,本项目拟从仿生强化学习角度出发,以智能机器人为研究对象并以其技能学习过程自主进化学习算法为核心,探究一种基于智能演进的技能学习方法,可使得机器人具备自主学习能力。首先类比人类技能学习过程,运用知识表示、示教学习等方法对机器人技能获取过程进行建模;其次,基于目标具体化、奖励引导和深度神经网络方法建立价值评价网络;再次,融合经验复用、贝叶斯程序学习和深度确定性策略等理论探究策略搜索方法;最后在六足机器人上进行技能学习实验,验证并完善提出的机器学习方法。以轮足一体化六足机器人为典型案例进行理论探索和验证,重点研究机器人技能学习机制及其技能水平智能演进方法两个关键科学问题。研究结果将使得机器人具备类人自我进化机制的技能学习能力,为机器人技能获取机制提供有价值的参考。
英文摘要
Skill ability is an important symbol of the intelligent level of robot, which is a typical label reflecting the grade of national economic, science, and technology. However, constant control program parameters will be not competent for skill learning process. Focusing on the autonomous evolution algorithm of intelligent robot, our project proposes a robot skill learning method based on intelligent evolution, which is initiated from the point of bionic deep reinforcement learning, so as to facilitating robot with automatic learning ability. Firstly, by analogy with human skill learning process, the process of robot skill acquisition is modeled by knowledge representation, imitate learning etc. secondly, the value evaluation network is established based on goal specification, reward shaping and deep neural network methods; thirdly, the strategy search method is explored by integrating experience replay, Bayesian program learning (BPL) and deep deterministic policy gradient (DDPG); finally the skill learning experiment is carried out on the hexapod robot to verify and improve the proposed machine learning method. Taking the wheel-foot integrated hexapod robot as a typical case study, this project will make theoretical exploration and verification, and the two key scientific problems are given on robot skills learning mechanism and the intelligent evolution method of robot skill. The research results will enable the skill learning ability of robot to possess the characteristics of intelligent evolution, so as to realize the skill learning ability of human-like evolutionary mechanism, providing a valuable reference for robot skill acquisition mechanism.
本项目聚焦于提升服务机器人在复杂环境中的自主学习能力和运动技能水平,通过融合深度强化学习、策略蒸馏、进化策略等前沿算法,取得了显著成果。在算法创新层面,项目团队提出多种创新算法。融合元学习和 PPO 算法的 MPPO 算法,让四足机器人运动控制学习更高效,避免陷入局部最优,提高学习成功率;基于动态奖励塑形的 MRPPO 算法,引入动态奖励引导,增强学习引导,提升学习速度与成功率;引入知识固化的 E-MRPPO 算法,稳定训练后期性能,精细化策略,提高最终效果。还有 DAAC 算法和 CPER-DAAC 算法,解决 DDPG 算法 Q 值过估计问题,提升步态学习效率和稳定性。控制策略优化方面,项目将 MPC 与深度强化学习结合,精准控制四足机器人足端轨迹,提高运动稳定性和适应性。策略蒸馏柔性动作评价 PDSAC 算法,通过控制器输出动作计算动作价值函数,形成混合策略,加快奖励函数收敛速度,提升稳定性。环境感知与适应能力增强也是重要成果。基于自主环境感知的运动技能学习算法,通过深度相机获取地形信息,融合本体感知信息,使四足机器人能主动获取环境信息,解决障碍物环境下的运动策略学习问题,提升不同障碍物、地形下的运动能力和稳定性。分层控制的强化学习系统,实现足端与地面接触状态的及时感知和反馈,提高腿部适应复杂环境的能力,让四足机器人能适应阶梯、斜坡等复杂地形。项目研究成果具有重要科学意义和广阔应用前景。为服务机器人在复杂环境下的运动控制提供新方法,推动技术发展。实际应用中,可应用于军事侦察、灾难救援、工业检测、医疗援助等领域,提高机器人作业能力和效率。例如,四足机器人可利用所学运动技能快速适应复杂地形,执行搜索救援任务,提高救援效率和成功率;在工业检测中,稳定行走于不同地形,进行设备巡检和数据采集,提升检测准确性和可靠性。未来,项目团队将持续深化研究,优化算法性能,拓展应用场景,探索算法在更多机器人类型和复杂任务中的应用,以及实际物理机器人部署,助力服务机器人技能学习技术发展。
国内基金
海外基金