来源:期刊VIP网 时间:
作者:孙凯玮;王玫;阚瑞祥;刘鑫;仇洪冰;林桂耀;
单位:桂林理工大学计算机科学与工程学院;桂林电子科技大学信息与通信学院;
摘要:声音分类技术在校园事件监测中至关重要。然而,声音识别领域存在诸多挑战,如特征提取方法的适配性不足、现有方法难以平衡学习、理解能力与模型复杂度之间的关系等。为解决这些问题,文中提出一种基于LM-H声学特征和RCB-EfficientNet模型的改进算法。从原始音频中提取Log-Mel和Hilbert谱图特征,融合为全新的LM-H特征来描述校园异常声,并提出轻量化音频分类模型RCB-EfficientNet。通过减少主要模块的堆叠和模型参数量,并添加特征层间的跳跃连接保证信息传递,同时通过替换注意力模块来避免信息丢失。最后,在基于数个公开数据集重组而成的自建数据集上进行实验,改进后的模型参数量为2.69 MB,减少了1.32 MB,总体下降32%,同时实现了98.70%的精度。证实了该改进算法在维持轻量级计算的同时,具有高准确性和稳健性。
关键词:声音分类;;特征融合;;校园异常声;;声学特征;;轻量化;;注意力模块
基金资助:国家自然科学基金项目(62071135);国家自然科学基金项目(61961010);; 桂林电子科技大学研究生创新项目(2023YCXB05)