来源:期刊VIP网 时间:
作者:吴杰宏;刘朕亦;李丹阳;
单位:沈阳航空航天大学计算机学院;
摘要:水下无人航行器(Unmanned Underwater Vehicle, UUV)凭借智能化程度高、安全性强和环境适应性强等优势,已成为大范围海洋探索的重要工具,但存在信度分配不合理、长时间依赖和探索效率低下等问题。针对这些挑战,提出了融合群组内在好奇心机制(Group Intrinsic Curiosity Mechanism, GICM)和长短期记忆网络(Long Short-Term Memory, LSTM)的多智能体深度确定性策略梯度(Multi-Agent Deep Deterministic Policy Gradient, MADDPG)算法,即GL-MADDPG算法。该算法通过基于LSTM的信度分配机制解决了多智能体环境中的奖励分配问题,利用GICM提高了环境探索效率,并创新设计了网络异步合作更新机制提高训练稳定性和收敛速度。实验结果表明,相比传统MADDPG算法,GL-MADDPG算法提高搜索完成率12.6%,减少搜索时间20.6%,降低重复覆盖率72.7%,且在通信受限、UUV故障等挑战场景下表现出卓越的鲁棒性。
关键词:水下无人航行器;;多智能体协同搜索;;深度强化学习;;信度分配;;群组内在好奇心;;长短期记忆网络;;异步合作更新机制
基金资助:国家自然科学基金(62376165)~~