《电子与信息学报杂志》发表论文赏析
作者:王泽昊, 朱振华, 谢童欣, 汪玉
单位:清华大学电子工程系 北京 100084
摘要:混合专家已经成为当前进一步提升大语言模型推理能力的重要方法。当下,受限于算力与显存,通过扩大稠密大语言模型参数规模来提高模型推理能力的方法已经陷入瓶颈,即全参数激活带来了严重的显存与算力不足问题。混合专家机制通过构建由多个专家子网络组成的分布“知识库”,在提升大语言模型参数规模的同时,通过路由函数动态选择专家子网络来控制单次推理计算总量。然而,这种动态专家选择机制带来了显著的资源管理和调度问题,需要在加速系统和硬件架构层面有针对性地开展优化。该文将聚焦于混合专家大语言模型部署的系统与架构层:首先,概述了混合专家大模型的定义和发展趋势;之后,详细介绍了现有混合专家大语言模型的系统与架构优化技术并深入分析;最后,该文对混合专家大模型的优化技术进行总结和展望。
关键词:大语言模型, 混合专家, 加速系统, 硬件架构
基金资助:国家自然科学基金(62325405),北京信息科学与技术国家研究中心(BNR2024TD03001)