来源:期刊VIP网 时间:
作者:朱炫鹏;姚海东;刘隽;熊先奎;
单位:中兴通讯股份有限公司;
摘要:基于Transformer架构的大语言模型展现出强大的能力,是人类迈向通用人工智能(AGI)的一个重大进步。大语言模型架构和算法的演进分为提高推理效率、提高模型能力两条技术路线。介绍了两条技术路线主流的技术方案和思路。提高推理效率的方法有分布式推理、计算优化、访存优化、量化等;提高模型能力主要是引入新的架构,如混合专家(MoE)模型、状态空间模型(SSM)等。
关键词:大语言模型;;Transformer;;注意力