来源:期刊VIP网 时间:
作者:张艺然;李海燕;聂莹;
单位:中国中医科学院;
摘要:目的 基于大语言模型构建结构化中医黄疸病古籍语料库,为现代黄疸病临床与科研提供数据支撑,也为中医古籍知识的深度挖掘与利用提供思路。方法 系统整合互联网开源数字化中医古籍资源,采用文献计量学方法构建黄疸病名术语库,利用Python正则表达式进行关键词匹配和语料抽取,设计“病-证-症-治-效”五元信息抽取模型,制定标注指南并采用双人背对背标注结合第三人仲裁形成标准测试集,为筛选适配实体信息抽取的最优模型,采用DeepSeek-R1与ChatGPT-o3 2个大语言模型进行对比性能评估,通过调用大模型应用程序编程接口(API)进行实体信息抽取。结果 构建了涵盖从先秦至清代561本古籍、10 243条语料的中医黄疸病古籍语料库。模型对比评估结果显示,DeepSeek-R1在17类实体识别的性能全面优于ChatGPT-o3,并基于该优选模型从语料库中抽取出41 407个实体,涵盖病名(6238个)、证型(1622个)、方剂(2631个)、中药(2706个)等17个实体类型。结论 基于DeepSeek-R1大语言模型构建的语料库覆盖了黄疸病核心辨证论治要素,可为后续中医黄疸病历史演变和辨证论治规律研究奠定基础,并为AI驱动的中医古籍知识挖掘提供可复制的技术范式。
关键词:中医古籍;;黄疸病;;语料库;;大语言模型;;信息抽取
基金资助:中国中医科学院科技创新工程(CI2021B002);中国中医科学院基本科研业务费(ZZ170307);; 江苏省前沿技术研发计划(BF2025076)