来源:期刊VIP网 时间:
作者:张蔚;
单位:河南应用技术职业学院;
摘要:针对无人机航拍图像多尺度目标语义分割任务中小目标分割精度与跨尺度特征对齐等方面的局限性,提出TransSeg模型,通过融合Swin Transformer的全局建模能力与U-Net对称编解码架构,并引入D-ASPP和残差注意力机制,损失函数采用Dice Loss与Focal Loss协同优化策略。实验基于UAVid数据集,对比DANet、BiSeNet、SegFormer等主流模型,验证了TransSeg在8类城市场景目标分割中的有效性,并在自定义数据集上有着良好的表现。结果表明,模型平均IoU达66.9%,较SegFormer提升0.9%,其中,移动车辆、行人等小目标IoU分别提升4.1%和5.6%。研究揭示了全局上下文建模与动态多尺度融合机制对提升分割性能的关键作用,为无人机遥感图像处理提供了新的解决方案。
关键词:无人机航拍图像;;语义分割;;多尺度目标;;Swin Transformer;;D-ASPP;;残差注意力机制
基金资助:河南省教育厅资助项目(ZJC18020,ZJC17098)