我们的服务符合学术规范和道德
专业 高端让您使用时没有后顾之忧

外语研究2025年第06期:大语言模型的术语自动抽取性能评估——基于ACTER数据集的实证研究

来源:期刊VIP网 时间:


作者:刘世界;王华树;

单位:上海海事大学外国语学院;根特大学艺术与哲学学院;北京外国语大学高级翻译学院;

摘要:术语自动抽取是自然语言处理中的关键任务,对文本分类、本体构建、情感分析、机器翻译及其质量评估等任务具有重要价值。大语言模型已在多种自然语言处理任务中展现出卓越性能,但在术语自动抽取领域的应用研究尚待深入。本研究基于高质量术语标注数据集ACTER开展实证研究,系统评估Llama-3.3-70B-Instruct、Qwen2.5-72B-Instruct、DeepSeek-V3-0324、Claude 3.7 Sonnet等8种主流开源和闭源模型在零样本条件下的术语抽取性能。实验结果表明,闭源模型Claude 3.7Sonnet表现最为优异,术语级别的F1值达0.722,较基线模型提升了264.6%;开源模型DeepSeek-V3-0324和Qwen2.5-72BInstruct同样表现出色,F1值分别为0.662和0.687。分析发现,大语言模型在术语自动抽取任务中主要面临两类挑战:上下文描述误判和术语边界识别错误(过度扩展与术语截断);模型对复合术语和专业名词识别尤为困难,在术语类型上呈现一致性能梯度(常见术语>特定术语>命名实体>领域外术语)。期待本研究能够为大语言模型在术语自动抽取任务中的应用提供基准参考,并为理解大语言模型在特定领域自然语言处理任务中的能力边界提供启示。

关键词:大语言模型;;术语自动抽取;;零样本学习;;ACTER;;提示词

基金资助:国家社科基金项目“数字人文视域下译者数字素养研究”(编号:22BYY043);; 国家留学基金委员会国家建设高水平大学公派研究生项目(编号:202408310292)的阶段性成果