我们的服务符合学术规范和道德
专业 高端让您使用时没有后顾之忧

实验室研究与探索2025年第01期:基于深度Q网络的平衡杆优化控制实验教学案例设计

来源:期刊VIP网 时间:


作者:钟珊;杜鑫;司亚利;刘井莲;严卫;

单位:常熟理工学院计算机科学与工程学院;南京大学计算机软件新技术全国重点实验室;苏州科技大学电子信息与工程学院;

摘要:为了使学生更深入地掌握采用强化学习求解任务最优策略的方法,基于深度Q网络设计了平衡杆的控制优化实验。将平衡杆实验环境建模为马尔可夫决策模型,从深度Q网络结构、探索策略、奖励函数、经验回放池更新和目标Q网络更新等角度进行了实验方案的设计。实验评估综合考虑了算法有效性、Q值估计的准确性、样本效率和Q网络的损失估计。在此基础上,将其与基准算法Q学习算法在累计奖赏和学习效率上进行了对比。该实验不仅可以帮助学生学会综合应用强化学习知识,也能帮助其掌握采用深度Q网络算法来求解离散动作空间任务的最优策略。

关键词:强化学习;;深度Q网络;;Q学习;;平衡杆;;实验设计

基金资助:国家自然科学基金面上项目(62376041);国家自然科学基金青年项目(621023471);; 中国高等教育学会“十四五”规划专项课题(21JSYB16);; 江苏省高等教育质量保障与评价研究课题(2021-C01);; 南京大学计算机软件新技术全国重点实验室开放课题项目(KFKT2024B51)