什么是 AWQ?

AWQ(激活感知权重量化)是一种训练后、仅权重量化方法。它利用激活分布识别关键权重通道,并搜索等价的逐通道缩放以降低这些通道的量化误差,而不需要保留混合精度权重子集。

快速了解

全称激活感知权重量化
创建时间2023 年由 Ji Lin 等人(MIT)提出
规范文档官方规范

工作原理

AWQ 基于一个核心观察:结合激活幅度分析时,少量权重通道可能对模型输出尤其重要。它从校准集收集激活,搜索通道缩放因子,并在低位宽权重量化前执行等价变换。论文方法不需要反向传播或权重重建。AWQ 描述的是制品生成机制,不保证固定文件大小、延迟、吞吐或质量;这些结果取决于基础 Checkpoint、校准覆盖、位宽、分组大小、打包布局、运行时内核、硬件和工作负载。因此,AWQ 与 GPTQ 应在受控条件下比较,不能使用通用排行榜决定生产选型。

主要特点

  • 属于训练后、仅权重量化方法
  • 利用激活分布识别关键权重通道
  • 通过等价逐通道缩放降低量化误差
  • 不需要反向传播或权重重建
  • 需要代表性校准数据和固定量化配方
  • 依赖兼容的打包布局、运行时内核与硬件

常见用途

  1. 评估面向 GPU 推理的低位宽权重制品
  2. 在存在受支持内核时减少权重内存流量
  3. 为已验证 AWQ 兼容性的运行时打包大模型
  4. 在统一校准契约下比较仅权重量化方法
  5. 通过业务质量与 Goodput 门禁后提升服务容量

示例

loading...
Loading code...

常见问题

AWQ 是如何工作的?

AWQ 使用校准集的激活分布识别关键权重通道,再搜索等价的逐通道缩放,使这些权重更容易量化。相应的逆缩放作用于激活,因此在引入舍入误差之前,原始线性运算保持等价。

AWQ 的精度一定优于 GPTQ 吗?

不一定。AWQ 与 GPTQ 采用不同方式优化权重量化,没有跨模型和跨任务的固定质量优势。应从相同基线生成制品,保持 Tokenizer、Chat Template、校准数据、工作负载与质量门禁一致后再比较。

AWQ 一定能加速推理吗?

只有运行时和硬件具备匹配制品精确打包布局的高效内核时,权重流量下降才可能转化为加速。反量化、算子回退、小 Batch、KV Cache 压力或重打包都可能抵消收益,应分别测量 TTFT、Token 间延迟、吞吐和 Goodput。

AWQ 需要多少校准数据?

不存在通用样本数量。校准集需要代表生产语言、领域、Prompt 长度、工具调用和敏感任务切片。团队应记录数据集 Revision、采样策略与校验和,并验证所选缩放参数是否稳定、下游行为是否保持。

哪些运行时支持 AWQ?

兼容性会随运行时版本、模型架构、张量布局、内核和硬件变化。应查看目标运行时当前官方支持矩阵,固定版本,核验实际加载的内核路径,并对精确制品执行基准。能够成功加载不等于生产路径高效或正确。

相关术语

相关文章