来源:期刊VIP网 时间:
作者:李鸣野;吕明华;张俊芳;姚仁太;郭欢;牛嫣静;赵丹;李煜;田芷洁;
单位:中国辐射防护研究院;中核核环境模拟与评价技术重点实验室;
摘要:针对核事故情境下复杂多变的防护行动决策问题,本文提出一种融合马尔可夫决策过程与深度强化学习的动态优化模型。该模型包含执行环境模块、深度强化学习网络模块和优化决策模块三大模块,通过奖励函数引导机制与状态映射机制实现路径优化、隐蔽等策略组合的智能生成。在核事故后果评价系统模拟条件下,该模型经约200轮训练后实现收敛,训练时长控制在10 min以内,可有效降低剂量暴露、提升疏散效率并优化路径合理性。研究结果验证了该模型在复杂核应急响应中的策略适应性与优化能力,为构建智能化核事故辅助决策系统提供了方法依据与工程参考。
关键词:防护行动;;马尔可夫决策过程;;深度强化学习;;动态优化