来源:期刊VIP网 时间:
作者:吕王靖;戚兆波;孙承文;柴婷婷;张维刚;
单位:哈尔滨工业大学(威海)计算机科学与技术学院;
摘要:视频长时动作预测任务旨在理解观测视频内容,并预测视频中行动者在较长时间跨度内的动作序列。该任务面临的挑战在于未来的不确定性,体现在动作中动词和名词的预测上:一方面,名词的预测空间庞大且存在冗余;另一方面,动词在动作序列中的演变具有多样性;并且,动词与名词之间的组合关系复杂。对此,本研究提出一种双分支视频长时动作预测网络,构建双分支聚合与修正框架:引入名词预测增强分支,侧重提取视频中的细粒度视觉特征,加强视觉建模,从而提升名词预测的准确性;引入大型语言模型加强对动作序列的时序建模,以提高动词预测的稳定性与合理性。在此基础上,设计跨分支融合策略,对两路预测结果进行加权融合,并结合动词-名词共现先验,对结果进行约束与修正,使生成的动作序列更加符合真实行为逻辑。实验结果表明,本研究所提出方法在多个评估指标上均优于现有方法,显著提升了模型对复杂视频内容的理解能力以及长时序预测性能。
关键词:长时动作预测;;视频理解;;细粒度视觉特征
基金资助:国家自然科学基金(No.62441232,No.62306092,No.62476068,No.62506095);; 山东省自然科学基金(No.ZR2025ZD01,No.ZR2024QF066)