来源:期刊VIP网 时间:
作者:赵子豪;彭称称;张维海;
单位:青岛理工大学信息与控制工程学院;山东科技大学电气与自动化工程学院;
摘要:本研究利用强化学习研究了系统部分未知的无限时域合作线性二次微分博弈的Pareto最优性问题。首先,在仅知道部分系统动力学矩阵参数的前提下,通过收集每个玩家的状态信息来推导策略迭代算法,得到相应代数黎卡提方程的近似解;然后,通过递归推导严格证明了算法的收敛性。在凸优化理论的基础上,采用加权法求解Pareto最优策略和Pareto最优解。最后,通过仿真结果验证了所提理论算法的可行性。
关键词:策略迭代;;Pareto最优;;合作微分博弈;;线性二次理论;;强化学习
基金资助:国家自然科学基金项目(62203247,62373229)