来源:期刊VIP网 时间:
作者:张晶;周凯;吴文涛;
单位:山西铁道职业技术学院智能控制系;太原理工大学信息与计算机学院;中国空间技术研究院西安分院;
摘要:针对现有视频内容描述方法忽略对视频中活动信息的关注、对关键信息挖掘不够充分的问题,本研究提出了一种基于交叉注意力和语义感知的视频内容描述方法。首先,以视频活动为边界,利用聚类算法将视频切分为多个不同时长的视频片段,并提取各片段的视觉特征;然后,使用设计的语义感知模块为视频设置语义标签;最后,构建交叉模态注意力模块,加强视觉特征中关键信息的特征表示,生成描述语句,并在公开数据集上测试验证。结果表明,本研究模型在BLEU、METEOR和ROUGE-L指标上有显著的提升,相较于当前的主流视频内容描述模型,在单词匹配、语义匹配、可读性等多方面有明显的改善。
关键词:视频内容描述;;视频理解;;注意力机制;;多模态;;语义检测
基金资助:国家自然科学基金项目(No.61802124)