来源:期刊VIP网 时间:
作者:黄海权;韩光;
单位:南京邮电大学通信与信息工程学院;
摘要:在现实场景中应用文本定位识别方法时,推广至与训练数据场景存在差异的新场景的能力必不可少。然而,现有多数方法采用海量数据驱动方式,将大量常见场景文本图像数据输入深度学习模型进行预训练或微调,此类模型在公共测试集上可取得良好性能,但缺乏适配新场景的应用能力。为此,提出一种基于特征交互的差异化场景文本定位识别网络(Feature Interaction-based Differential Scene Text Spotter Network, FIDNet),可对常见场景与新场景的文本实现高效定位识别。FIDNet采用文本定位与文本识别协同化架构,借助多层次双向融合(Multi-Level Bidirectional Fusion, MLBF)网络深度提取图像特征,对潜在子任务对应的文本特征开展自适应加权交互与迭代优化,进一步提升模型文本定位识别性能。实验结果表明,所提方法可有效定位识别各类形状文本,并能快速应用于新场景。
关键词:文本定位识别;;文本识别;;多层次双向融合;;自适应特征加权交互
基金资助:国家自然科学基金(61871445)~~