我们的服务符合学术规范和道德
专业 高端让您使用时没有后顾之忧

战术导弹技术2025年第06期:基于深度强化学习的六自由度无人机导弹规避策略

来源:期刊VIP网 时间:


作者:徐可意;李辉;谭泰;李杰;

单位:四川大学视觉合成图形图像技术国家级重点实验室;四川大学计算机学院;成都蓉奥科技有限公司;

摘要:在超视距空战中进攻方的作战优势提升,规避空空导弹成为提升无人机存活率重要的能力。针对深度强化学习算法在导弹规避训练中存在的收敛困难、智能体泛化性差、六自由度无人机难以控制、大机动后无人机易失控等问题,提出了一种分层框架下基于门控循环单元(GRU)并结合余弦退火算法(Cosine Annealing)的改进近端策略优化(PPO-Clip)算法(GC-PPO)。GC-PPO算法作为策略生成层生成高层策略,比例-积分-微分(PID)控制器作为控制层,将高层策略转换为真实控制指令。同时,使用余弦退火算法动态调整学习率,并设计了包含奖励塑造的奖励函数体系来引导训练过程快速收敛。通过随机生成的仿真实验对比有无奖励塑造的PPO算法、在分层框架下的PPO算法以及在分层框架下的GC-PPO算法。实验结果表明,GC-PPO算法在随机生成的多种超视距空战场景中均能有效规避导弹且保持平稳飞行,收敛速度和模型泛化性均优于其余几种算法,极大提高了无人机的存活率。

关键词:导弹规避;;超视距空战;;深度强化学习;;门控循环单元;;分层框架;;近端策略优化算法;;六自由度无人机

基金资助:国家自然科学基金民航联合基金(U2433217)