来源:期刊VIP网 时间:
作者:刘仲民;王学臻;胡文瑾;
单位:兰州理工大学电气工程与信息工程学院,甘肃省工业过程先进控制重点实验室;重庆长安汽车股份有限公司;西北民族大学数学与计算机科学学院;
摘要:针对图像描述任务中特征信息利用不充分、背景信息易被忽略、生成语句的可控性存在欠缺等问题,使用特征融合模块和基于Transformer编/解码器的文本解码增强网络,提出一种融合扩散文本的图像描述算法.输入图像由Vision Transformer骨干网络提取细粒度信息,并在解码器中将原始的BERT网络结构替换为新型的DeBERTa网络结构,提升了Transformer模型的解码效果.文本扩散方法对图像描述语句的生成过程进行监督,减少描述语句的无序化.用强化学习方式对模型进行微调,优化最终描述语句生成结果.将提出算法在MS-COCO数据集中进行定量评估和线上对比测试.结果表明,模型在BLEU-1、 BLEU-4、 METEOR、 ROUGE-L、 CIDEr、 SPICE数据集上的性能分别提高2.1%、3.1%、 1.7%、 2%、 3.2%、 2.6%,且模型的微调过程更加稳定,对图像的语义表述更加准确有序.
关键词:图像描述;;特征融合;;Transformer模型;;扩散模型;;强化学习
基金资助:国家自然科学基金项目(62061042);; 甘肃省工业过程先进控制重点实验室开发基金项目(2022KX10)