来源:期刊VIP网 时间:
作者:邓永恒;章晋睿;岳晟;任炬;
单位:清华大学计算机科学与技术系;中山大学网络空间安全学院;中关村实验室;
摘要:近年来,大语言模型技术在多个领域取得了突破性进展,为实现泛在智能提供了坚实的基础。然而,泛在智能要求在各种场景中实现无缝的智能体验,这对大语言模型的部署和应用提出了新的挑战。云上部署大模型时,面临实时性、安全性和个性化需求难以兼顾的问题,限制了其在不同环境中的适用性。这些挑战促使研究者探索端侧部署大语言模型的前景,以期在更接近数据源的位置实现更高效的智能服务。然而,端侧的资源限制为大语言模型的部署、推理与应用带来了严峻的挑战。本文首先探讨了这些挑战,并系统梳理了端侧大模型部署与推理应用的关键技术进展,包括模型压缩、运行时优化和端边云协同等方面的前沿研究,并深入分析了相关技术在实际应用中的优势与局限性。最后,本文对大语言模型实现泛在智能的未来发展方向进行了展望,包括模型轻量化、新型计算架构支持、隐私保护技术创新以及端边大小模型协同优化等技术,力求推动大语言模型在端侧的高效落地与应用。
关键词:大语言模型;;泛在智能;;端侧部署;;模型优化;;边缘计算;;隐私保护
基金资助:国家自然科学基金项目(62402267,62432004)的资助