来源:期刊VIP网 时间:
作者:黄溪;王先兵;林海;何涛;
单位:武汉大学国家网络安全学院空天信息安全与可信计算教育部重点实验室;中国科学院计算技术研究所;
摘要:视觉Transformer在图像分类任务方面表现出色。相较于卷积神经网络,其结构中的自注意力机制能够有效消除图像中噪声的影响,提取出图像关键特征信息表达。鉴于图像检索任务需要从图像中获取高质量的特征描述向量以提高检索的准确率,提出了一种以视觉Transformer模型为骨干网络的特征提取框架,针对视觉Transformer中的多层自注意力结构,通过自集成的方式融合多个自注意力层的特征输出作为最终图像特征,以提升模型的检索效果。在热门的公开数据集In-shop Clothes Retrieval和Stanford Online Product上进行了实验,结果表明所提方法能够有效提升视觉Transformer提取特征的检索效果,并且优于其他6种先进的图像检索方法。
关键词:视觉Transformer;;图像检索;;自集成;;自注意力;;排序损失
基金资助:国家自然科学基金重点项目(编号:72132008)