来源:期刊VIP网 时间:
作者:姜博;王星;王建新;
单位:中国人民大学应用统计科学研究中心;中国听力医学发展基金会噪声防控专委会;北京绿创声学工程股份有限公司;中国人民大学统计学院;
摘要:目的 分析噪声聋与夸大聋的关键分类特征,探究机器学习识别夸大聋的效果。方法 以979例疑似噪声聋患者的双耳听力曲线为基础,通过专家标注与数据清理,构建样本量为1 838例(其中噪声聋样本792例,夸大聋样本1 046例)的二分类数据库。设计了一套适用于多形态噪声聋样本下的夸大聋识别多轮迭代的特征工程方案,分别为支持向量机(support vector machine, SVM)、多层感知机(multilayer perceptron, MLP)、极限梯度提升(extreme gradient boosting, XGBoost)、残差网络(residual network, ResNet)及逻辑回归模型,构建了相匹配的特征集,采用递归特征消除法(recursive feature elimination, RFE)与置换重要性法完成特征重要性排序并筛选,确定进入集成模型的特征以及模型组合。经参数调优后建立各单一模型及不同基模型与元模型组合的集成模型,评估结果并分析比较。结果 本研究发现“1 kHz/4 kHz阈值比”、“∠1-4-6 kHz与∠0.5-1-3 kHz的角度比(简称为R)”为关键特征;1 kHz/4 kHz阈值比>0.6且R>1.2作为夸大聋判断阈值时,朴素贝叶斯集成堆叠模型(四基模型组合)的F1值最高,为0.845 4,优于其他机器学习方法,用此模型验证夸大聋判断阈值,敏感度为86.79%,特异度为75.32%。结论 本研究提炼出的夸大聋与噪声聋分类模型可作为噪声聋初步筛查工具。
关键词:听力曲线;;夸大聋;;特征工程;;机器学习;;集成模型
基金资助:国家社科基金项目(18ATJ004)