我们的服务符合学术规范和道德
专业 高端让您使用时没有后顾之忧

武汉大学学报(理学版)2025年第04期:基于多尺度与多级语义融合Transformer的人体姿态估计

来源:期刊VIP网 时间:


作者:李俊;袁通达;陈黎;

单位:武汉科技大学计算机科学与技术学院;智能信息处理与实时工业系统湖北省重点实验室;

摘要:针对人体姿态估计任务中视觉Transformer模型存在的尺度多样性受限和近距离信息忽视问题,提出多尺度与多级语义融合Transformer(MMSF)模型。该模型通过引入关键点标记作为代理的交叉Transformer操作,实现了不同分辨率视觉信息的相互学习,提高了估计精度。同时,利用深度卷积和稠密连接复用标记技术,有效提取了含有多级语义信息的交叉标记,减少了编码器层堆叠,降低了模型复杂度。通过交叉标记与标准标记的交叉融合注意力操作,整合了多级语义信息,进一步增强了姿态估计效果。实验结果表明,在相同的条件下,MMSF模型在COCO数据集上达到了78.1%的平均精度,比TokenPose基准模型高2.3%;在MPII数据集上验证了其有效性,与近几年经典的基于Transformer的人体姿态估计方法相比取得了更好的性能。

关键词:视觉Transformer;;人体姿态估计;;深度卷积;;标记融合;;交叉注意力

基金资助:国家自然科学基金(62271359)