
来源:VB
华为位于苏黎世的计算系统实验室为大型语言模型 (LLM) 引入了一种新的开源量化方法,旨在在不牺牲输出质量的情况下减少内存需求。
该技术称为 SINQ(Sinkhorn-Normalized Quantization),旨在快速、免校准且易于集成到现有模型工作流程中。华为研究团队已在 Github 和 Hugging Face 上以宽松、企业友好的 Apache 2.0 许可证提供了执行该作的代码,允许组织获取和使用它、修改它并进行商业部署——所有这些都是免费的。
在不同大小的型号中,SINQ 可将内存使用量减少 60-70%,具体取决于架构和位宽。
这使得以前需要 >60 GB 内存的模型能够在 ~20 GB 设置上运行,这是在单个高端 GPU 甚至多 GPU 消费级设置上运行大型模型的关键推动因素。
这使得以前需要高端企业 GPU(如 NVIDIA 的 A100 或 H100)的型号可以在更实惠的硬件上运行,例如单个 Nvidia GeForce RTX 4090(约合 1600 美元),而不是像 A100 80GB(19,000 美元)甚至超过 100 美元的 H30,000 设备。
对于使用云基础设施的团队来说,节省的费用同样是切实的。基于 A100 的实例通常每小时收费 3-4.50 美元,而 RTX 4090 等 24 GB GPU 在许多平台上的收费标准为每小时 1-1.50 美元。
随着时间的推移,特别是对于扩展推理工作负载,这种差异可以减少高达数千美元的成本,同时还可以在较小的集群、本地工作站或以前受内存限制的消费级设置上解锁 LLM 部署。
应对大语言模型的记忆挑战
运行大型模型通常需要在性能和大小之间做出妥协。
在实践中,神经网络使用浮点数来表示权重和激活。浮点数可以表示范围很广的值(非常小、非常大、小数部分)。
这种灵活性很有帮助,因为在训练和推理过程中,权重和激活的规模可能会发生巨大变化。使用浮点可以让模型精确调整。(例如,权重可以是 0.0023 或 123.45,浮点可以以相当的精度捕获两者。
量化——一种降低模型权重精度的方法——提供了降低内存使用量的实用途径,但通常会在模型质量方面进行权衡,尤其是在 4 位及以下精度下。
当您将这些浮点值转换为精度较低的格式(如 8 位整数)时,您是在近似它们。
这意味着您使用更少的位进行存储和计算,这速度更快、内存效率更高,但您可能会失去保真度(即引入小错误)。
诀窍是仔细进行转换,以便模型的行为几乎保持不变,即使它在内部使用这些权重和激活的更粗略的近似值。
SINQ 通过引入即插即用解决方案解决了这些痛点,即使在低精度设置下也能提供强大的性能,而无需校准数据或层间依赖关系。
SINQ 的工作原理
SINQ 方法引入了两项主要创新:
双轴缩放:SINQ 不使用单个缩放因子来量化矩阵,而是对行和列使用单独的缩放向量。这有助于减轻异常值的影响,并允许量化误差更灵活地分布在整个矩阵中。
Sinkhorn-Knopp 式归一化:受 Sinkhorn 迭代启发的快速算法用于规范化矩阵中行和列的标准差。这有助于最大限度地减少作者所说的“矩阵不平衡”,这是一种新的代理指标,在提高量化性能方面比峰度等替代方案更有效。
这两个功能的结合使 SINQ 能够在多个基准测试中优于其他免校准技术,例如四舍五入 (RTN)、HQQ 和基于 Hadamard 的量化。
性能和兼容性
SINQ 已在广泛的架构和模型中进行了评估,包括 Qwen3 系列、LLaMA 和 DeepSeek。
在 WikiText2 和 C4 等基准测试中,与基线方法相比,SINQ 始终降低困惑度和翻转率,通常接近或匹配校准解决方案的性能。
它还支持NF4等非均匀量化方案,并可与AWQ等校准方法结合使用,从而产生变体A-SINQ。在校准设置中,A-SINQ 进一步缩小了与全精度模型的差距。
在运行效率方面,SINQ 量化模型的速度大约是 HQQ 的两倍,是 AWQ 的 30 倍以上。这使得它非常适合量化时间是实际限制的研究和生产环境。
开源且易于使用
华为已将 SINQ 作为开源项目发布,并具有宽松的、企业友好的 Apache 2.0 许可证,并在 GitHub 上提供了实现说明和可复制性工具:
该存储库包括支持仅使用几行代码量化 Hugging Face 模型,以及用于保存和重新加载量化权重的工具。默认设置在内存节省和准确性之间提供了平衡,用户可以根据自己的需要自定义位宽、平铺策略和组大小等参数。
作者还通过库提供评估集成,并计划在不久的将来在 Hugging Face Hub 上发布预量化模型。lm-eval
展望未来
随着在消费级硬件上运行大模型的需求不断增长,量化正在成为必不可少的工具。SINQ 旨在降低 LLM 部署的进入门槛,使开发人员和研究人员能够有效地缩小模型,而无需在质量或兼容性方面进行重大权衡。
计划进行进一步的更新,包括与 Hugging Face Transformers 的集成和预量化模型版本,使其成为量化领域值得关注的项目。