来源:期刊VIP网 时间:
作者:赵克宝;李灵锋;陈茁;韩骏;尹瑞;
单位:河北建材职业技术学院机电工程系;中煤张家口煤矿机械有限责任公司;河北省高端智能矿山装备技术创新中心;
摘要:现有的机器人避障方法多依赖于预设规则或外部奖励信号,难以适应煤矿井下复杂多变的环境。为实现煤矿井下运输机器人自主高效避障,提出了一种基于内在动机强化学习(IM-RL)算法的机器人自主避障方法。煤矿井下运输机器人通过视觉传感器感知外界环境信息,利用基于好奇心的内在动机取向函数计算判别外界环境属性的内部奖赏值,利用外部动机奖励函数计算其动作属性的外部奖赏值,结合内在动机取向函数的奖励权重和外部动机奖励函数的奖励权重,计算运输机器人执行动作前后状态的综合奖赏值,形成强化学习算法奖励机制,通过深度置信网络对其状态进行训练和学习,激励运输机器人主动探索未知环境,同时利用自身记忆机制存储知识和经验,通过不断学习训练实现自主避障。在静态环境、动态环境和煤矿井下实际环境中分别进行运输机器人自主避障实验,结果表明:基于IM-RL算法的机器人自主避障路径和搜索时间较短,具有较强的泛化性和鲁棒性。
关键词:内在动机;;强化学习;;运输机器人;;自主避障;;路径规划
基金资助:国家重点研发计划项目(2017YFF0210606);; 河北省高等学校科学研究计划项目(ZD2022018,ZC2024136)