中科院理论物理研究所苏刚研究员团队与首都师范大学冉仕举教授课题组开展跨学科研究,把量子物理领域的张量网络思路应用到大模型压缩技术当中,提出 Tensor Mixture(MixT)张量混合压缩框架。这套技术除缩减模型参数之外,还可以同步降低算力、显存以及能耗。相关研究论文近期发布在 arXiv 预印本平台,对应的技术已经拿到国家发明专利。

大模型技术近几年发展迅猛,但千亿级别的参数量抬高了训练和落地的成本,资源压力集中在少数头部科技企业,普通科研机构、中小企业以及个人开发者很难跨过这道使用门槛。

当前行业比较常用的剪枝、量化、低秩分解等压缩手段,主要依靠下调权重精度、构建稀疏结构来减少资源消耗,实际压缩效果很大程度受制于算法实现、计算内核以及硬件适配情况。MixT 的实现思路和上述方案并不相同,它不是单纯利用张量完成参数压缩,而是对变换器模块中原有的稠密线性映射重新构建,转化为可以直接运算的张量算子混合体。苏刚表示,MixT 完整保留张量运算体系,除实现参数精简,还可以同步减少计算开销与显存占用。

研究人员选取 LLaMA2‑7B 模型完成实测验证,在最优压缩条件下,模型总参数量下降 47.5%,推理计算量减少 37.1%,训练计算量下降 52.1%,推理显存占用降低 60.4%,并且在大规模多任务语言理解基准测试里,模型综合性能基本没有损失。苏刚解释,这代表同等 GPU 硬件条件下能够承载规模更大的模型,普通 GPU 硬件,也有机会运行过去只能部署在高端服务器上的大模型。

这项研究还发现了大模型压缩过程中的临界点效应。团队持续加大压缩比例后发现,压缩幅度尚未抵达阈值时,即便模型规模持续收窄,性能依旧可以基本维持稳定。一旦压缩程度越过这一临界值,模型能力就会出现断崖式下跌,表现和物理学中的相变现象类似。这一实验结果说明,大模型性能并不会随参数量提升而持续变强,想要维持基础智能能力,模型需要满足最低限度的结构复杂度,压缩临界点就是大模型智能水平发生突变的分界点。

本文由智算芯能前沿网编辑整理,转载请注明出处。