来源:期刊VIP网 时间:
作者:李玉洁;贾皓楠;零俐;周文凯;蒋政;丁数学;谭本英;
单位:桂林电子科技大学人工智能学院;桂林电子科技大学广西高校人工智能算法工程重点实验室;
摘要:针对现有视频摘要方法在建立长距离帧依赖性和并行化训练方面的局限性问题,提出一种基于多头集中注意力机制的无监督视频摘要模型(MH-CASUM)。将多头注意力机制融入集中注意力模型,改进长度正则化损失函数,优化损失阈值以选择模型参数,并结合视频帧的唯一性与多样性来丰富摘要信息,从而更高效地完成视频摘要任务。通过在SumMe和TVSum数据集上进行的F_1值、 Kendall相关系数和Spearman相关系数的评估实验,验证MH-CASUM模型的性能。结果表明:引入的多头注意力机制及在模型参数选择上损失阈值的改进方法使得MH-CASUM模型的视频摘要性能显著提升;与之前表现最佳的无监督视频摘要模型CASUM相比,MH-CASUM在TVSum数据集中的F_1值提升0.98%,证明了其在视频摘要任务中的优越性和竞争力。
关键词:视频摘要;;注意力机制;;多头集中注意力;;无监督方法
基金资助:国家自然科学基金项目(62076077);; 广西科技重大专项(桂科AA22068057);; 广西自然科学基金项目(2022GXNSFBA035644);; 认知无线电与信息处理教育部重点实验室2022年主任基金项目;; 桂林电子科技大学研究生教育创新计划项目(2025YCXS243)