来源:期刊VIP网 时间:
作者:谢浩;姚洪锡;钟晶;陈瓴;蒲建伟;
单位:中铁第四勘察设计院集团有限公司;西南交通大学土木工程学院;软通动力信息技术(集团)股份有限公司;
摘要:陆路交通基础设施领域设计规范具有结构化程度低、标注数据稀缺、嵌套实体难以学习等特点,为实现设计规范知识的智能化抽取,提高规范检索和应用的智能化水平,在调研大量文献的基础上,以线路、路基、桥梁、隧道等结构物的相关设计规范为例,提出“主语+条件+措施”的规范条文知识抽取规则,采用正则表达式对规范文本进行数据清洗,根据规范的格式特点定义规范的关键语义信息与待抽取关系的类型。基于清华大学大语言模型ChatGLM2-6B,采用LoRA微调方法进行人类反馈的强化学习模型训练,应用标注的数据集进行有监督学习,引入相似度算法自动打分排序进行奖励学习,采用KL散度算法,构建强化学习模型,并对抽取结果进行质量分析和结构化数据整合,建立规范知识图谱。结果表明,该强化学习模型训练收敛效果较好,质量评分超过90分,相对原大语言模型提升35%~99%。用于设计规范文本知识抽取任务时,可以较准确地抽取出规范条文中的“主语”“条件”“措施”的关键语义信息,挖掘嵌套文本语句中的逻辑或序列关系,抽取效果显著。建立了规范知识的非结构化数据治理方法,实现陆路交通领域设计规范知识的智能高效抽取,为知识图谱构建和知识应用的研发奠定基础。
关键词:大语言模型;;陆路交通;;设计规范;;知识抽取;;语义信息;;相似度算法;;强化学习模型
基金资助:国家重点研发计划项目(2021YFB2600404);; 中国铁建股份有限公司科技研发计划项目(2022-A02)