来源:期刊VIP网 时间:
作者:田萍芳;刘恒永;高峰;顾进广;祝歆;
单位:武汉科技大学计算机科学与技术学院;国家新闻出版署富媒体数字出版内容组织与知识服务重点实验室;湖北省智能信息处理与实时计算重点实验室;武汉科技大学大数据科学与工程研究院;北京联合大学管理学院;
摘要:为改善在低资源和少样本条件下对复杂司法命名实体识别的效果,提出了一种基于本体提示指导的司法命名实体识别方法,将大语言模型应用于司法命名实体识别。首先,以涉假司法文书为例,结合文书内容和现有司法文书领域本体采用“自顶向下”的方式构建涉假司法文书知识图谱本体模型。然后,基于本体模型构建指令,指令包括任务描述、本体描述、任务示例和司法文本四部分,对大语言模型进行指令微调以完成司法命名实体识别任务,其中本体描述部分用于在微调过程中加入实体的定义与关系信息。最后,选择本文构建的本体模型包含的12类细粒度实体,自行采集数据集用于实验,并将其与几种典型的传统实体识别方法进行比较,结果显示,在少样本微调的条件下,本文提出的方法表现效果更好。
关键词:司法文书;;命名实体识别;;大语言模型;;提示工程;;本体
基金资助:国家重点研发计划重点专项(2022YFC3300804);; 武汉市重点研发计划(2022012202015070);; 武汉市东湖高新区揭榜挂帅项目(2022KJB12);; 富媒体数字出版内容组织与知识服务实验室开发基金(ZD2023-11/01)