来源:期刊VIP网 时间:
作者:化晨昊;谭泰;江泰民;李辉;张建伟;
单位:四川大学计算机学院;四川大学视觉合成图形图像技术国防重点学科实验室;
摘要:在民用和军用领域,无人机(Unmanned Aerial Vehicle,UAV)编队的应用日益广泛;然而,对于复杂度较高的六自由度固定翼无人机模型,现有的编队控制研究相对有限。针对上述挑战,提出了分层近端策略优化算法(Hierarchical Guidance and Control Proximal Policy Optimization,HGC-PPO)。HGC-PPO基于分层架构,将编队控制分为制导层和控制层。HGC-PPO的无人机控制层采用了一种基于强化学习的多输入多输出架构,在编队制导层,基于课程学习策略以构建奖励函数,平滑了学习过程中的难度曲线。这种方法确保了训练的有效收敛,同时提高了样本利用率和训练效率。实验结果表明,HGC-PPO算法能够在保持高效的同时,实现稳定且精确的固定翼无人机编队控制。综上所述,HGC-PPO算法为六自由度固定翼无人机编队控制提供了一种有效的解决方案。
关键词:分层强化学习;;深度强化学习;;奖励塑造;;近端策略优化算法;;课程学习;;六自由度固定翼无人机;;编队飞行
基金资助:国家自然科学基金联合基金项目(U20A20161)