来源:期刊VIP网 时间:
作者:张涵;徐丽格;胡东浩;余宝贤;李百成;张翊;
单位:华南师范大学电子科学与信息工程学院(微电子学院);浩鲸云计算科技股份有限公司;
摘要:印章文本识别对现代数字化文档处理与身份核验至关重要,然而,实际复杂场景下的印章文本检测与识别普遍存在精准度不足的问题。针对此,文章提出一种基于深度学习的印章文本检测与识别方案:(1)为提升模型在复杂场景中印章文本检测的特征提取能力,以可微分二值化网络(DBNet)为基础架构,面向文本特征融合,设计了带有残差结构多尺度特征融合注意力机制模块(RES-EMA),提出一种新的印章文本检测模型(RE-DBNet)。(2)基于SVTR模型,优化得到新的印章文本识别模型(CASVTR):在特征提取阶段,采用Conv卷积模块替换局部混合模块,构建Conv+GM编码器,以强化模型对字符特征的提取能力;在特征解码阶段,针对性设计基于Transformer的CTC解码器,以解决传统模型解码过程存在的多路径解码与特征不对齐问题,提升文本识别精度。最后,在ICDAR2023-ReST公开数据集上,将RE-DBNet模型与VitDet、TPSNet、TrOCR模型进行印章文本检测对比,将CASVTR模型与SAR、ABINet、SRN等模型进行印章文本识别对比;比较RES-EMA、EMA、SE、CBAM等注意力机制模块对文本检测模型的性能差异;开展编码器分别为Conv+GM、LM+GM以及解码器分别为CTC、CTC+LSTM、CTC+BiLSTM、CTC+Transformer的模型在印章文本识别中的性能对比实验。实验结果表明:(1)RE-DBNet模型的印章文本检测召回率达98.54%,较对比模型中召回率最优的VitDet模型提升了1.94%;CASVTR模型的印章文本识别准确率、平均归一化编辑距离分别为90.32%、0.987 4,较对比模型中性能最优的ParseQ模型分别提升了1.84%、0.018 7。(2)与增加EMA模块的DBNet-EMA模型相比,RE-DBNet模型的Precision、Recall、Hmean值分别提高了2.7%、0.03%、1.47%;基于Conv+GM编码器的SVTR-Conv模型的Accuracy值比SVTR模型提高了0.85%,基于Transfor-mer的CTC解码器的CASVTR模型的Accuracy、ANED值分别比SVTR-Conv-BiLSTM模型提高了2.43%、0.003 8。综上可知,文章提出的基于深度学习的文本检测与识别方案有效解决了复杂场景下印章文本检测精度低、识别阶段CTC解码多路径干扰及特征不对齐的问题,可为实际复杂业务场景的印章文本检测与识别提供可靠的技术支撑。
关键词:自然场景文本识别;;文本检测;;印章识别
基金资助:国家自然科学基金项目(62401215);; 广州市重点研发计划(2023B03J1341,202206010127)