来源:期刊VIP网 时间:
作者:刘国群;王雨琪;廖志刚;
单位:哈尔滨工业大学;北京机电工程研究所;
摘要:无人飞行器在现实生活中因其模型的复杂性,基于学习的方法往往需要耗费大量的时间进行离线训练。因此,提出了一种基于知识抽取的强化学习路径规划方法,使无人飞行器能够在连续环境中完成路径规划。设计神经网络对无人飞行器气动模块进行知识抽取。采用深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)算法使无人机能够自主做出决策。此外,为避开障碍物,基于航路捷径提出了一种新型的威胁区计算方法,并基于此概念来塑造奖励。建立了一个有静态障碍物的环境,并使用提出的方法对代理进行训练。仿真结果验证了所提算法模型的有效性,证明无人飞行器能有效避开威胁区并准确到达目标地点。
关键词:无人飞行器;;路径规划;;强化学习;;知识抽取;;深度确定性策略梯度;;威胁区建模;;航路捷径;;神经网络
基金资助:国家自然科学基金项目(U2441206)