来源:期刊VIP网 时间:
作者:庞杰;闫晓东;赵小兵;
单位:中央民族大学;国家语言资源监测与研究民族语言中心;民族语言智能与安全治理教育部重点实验室;
摘要:在本文中,我们通过扩展LLaMA现有的词表,增加额外的20,000个朝鲜语Token,从而提高其对朝鲜语的编码和语义理解的能力;并且进一步使用朝鲜语数据进行继续预训练,使用朝鲜语指令微调数据集对模型进行SFT(Supervised Fine-Tuning),并分析不同数据量对指令精调效果的影响,经过继续预训练和指令微调后的模型显著提高了理解和遵循朝鲜语指令的能力。实验结果表明,新提出的模型Ko-LLaMA显著提高了原版LLaMA在理解和生成朝鲜语内容方面的能力。此外,在朝鲜语文本分类数据集YNAT上对Ko-LLaMA与擅长少数民族语言的CINO模型及CINO的多种模型组合以及原版LLaMA和GPT-3.5进行了效果对比。结果表明,Ko-LLaMA的朝鲜语文本分类能力远超CINO和CINO的组合模型以及LLaMA和GPT-3.5等未经过朝鲜语语料进行词表扩充和继续预训练的大语言模型。
关键词:朝鲜语;;大语言模型;;词表扩充;;继续预训练;;指令微调
基金资助:国家社科基金重点项目“多民族语言《十三经》跨学科研究及数据库建设”(22&ZD035)的阶段性成果