来源:期刊VIP网 时间:
作者:熊先奎;王程晨;蔡文豪;
单位:中兴通讯股份有限公司;
摘要:现代大模型规模随扩展定律持续扩大,近万亿的模型参数量带来了算法、硬件、工程领域的一系列困境。Transformer架构固有的计算效率低下问题愈发凸显,引发了研究人员对通用人工智能(AGI)实现路径的深入思考。一方面,针对现有自回归Transformer架构,已形成注意力机制、低精度量化、参数共享等算法改进方向,以及集群系统优化、硬件系统升级等工程改进方向;另一方面,下一代AI大模型计算范式正朝着不以next token prediction为核心的方向演进,具体包括两类路径:一是从更高抽象层次进行预测的扩散和联合嵌入预测架构,二是从物理第一性原理和计算基材特性出发构建的动力学模型、热力学模型和能量模型。同时,新型计算范式与新型计算基材相结合,有望从根本上改变传统AI算法软件与硬件割裂的局面,成为迈向AGI的高效路径。
关键词:大语言模型;;计算范式;;人工智能