来源:期刊VIP网 时间:
作者:陈锶奇;熊钊远;汪云飞;王昊杨;
单位:重庆交通大学信息科学与工程学院;重庆交通大学交通运输学院;
摘要:自动协商是实现多智能体系统中合作与协作的关键方式。尽管基于强化学习(Reinforcement Learning, RL)的协商智能体在各种场景中取得了显著的成功,但由于实现环境的限制,它们仍面临挑战。特别是这些智能体需要与对手进行大量的在线互动以进行训练,这在现实世界的应用中往往是不可行和不现实的。因此,需要一种新的方法,以便直接从离线数据集中学习有效的协商策略。此外,在随后的在线协商中,对手可能会因为各种原因(如风险态度的变化或市场条件的变化)而改变其策略。这些因素为自动协商带来了重大挑战。提出了一种新的协商智能体,通过离线—在线RL来提高协商智能体的能力。它使协商智能体能够:(1)利用基于RL方法的策略与对手交互,提高动态协商环境的适应能力;(2)从历史离线数据中学习协商策略,无需大量的在线交互;(3)在在线微调优化过程中,使得学习到的策略快速且稳定地提升性能。基于多种协商场景和最近自动化协商智能体竞赛(Automated Negotiating Agents Competitions, ANAC)中的获胜智能体,提供了广泛的实验结果。结果显示,该智能体的表现超过了最先进的智能体,并且即使对手转换到不同策略时仍保持有效。
关键词:自动协商;;深度强化学习;;智能体;;电子商务
基金资助:国家自然科学基金(61602391);; 天津市科技计划项目(22JCZDJC00580)~~