什么是 AWQ?
AWQ(激活感知权重量化)是一种训练后、仅权重量化方法。它利用激活分布识别关键权重通道,并搜索等价的逐通道缩放以降低这些通道的量化误差,而不需要保留混合精度权重子集。
快速了解
| 全称 | 激活感知权重量化 |
|---|---|
| 创建时间 | 2023 年由 Ji Lin 等人(MIT)提出 |
| 规范文档 | 官方规范 |
工作原理
AWQ 基于一个核心观察:结合激活幅度分析时,少量权重通道可能对模型输出尤其重要。它从校准集收集激活,搜索通道缩放因子,并在低位宽权重量化前执行等价变换。论文方法不需要反向传播或权重重建。AWQ 描述的是制品生成机制,不保证固定文件大小、延迟、吞吐或质量;这些结果取决于基础 Checkpoint、校准覆盖、位宽、分组大小、打包布局、运行时内核、硬件和工作负载。因此,AWQ 与 GPTQ 应在受控条件下比较,不能使用通用排行榜决定生产选型。
主要特点
- 属于训练后、仅权重量化方法
- 利用激活分布识别关键权重通道
- 通过等价逐通道缩放降低量化误差
- 不需要反向传播或权重重建
- 需要代表性校准数据和固定量化配方
- 依赖兼容的打包布局、运行时内核与硬件
常见用途
- 评估面向 GPU 推理的低位宽权重制品
- 在存在受支持内核时减少权重内存流量
- 为已验证 AWQ 兼容性的运行时打包大模型
- 在统一校准契约下比较仅权重量化方法
- 通过业务质量与 Goodput 门禁后提升服务容量
示例
Loading code...常见问题
AWQ 是如何工作的?
AWQ 使用校准集的激活分布识别关键权重通道,再搜索等价的逐通道缩放,使这些权重更容易量化。相应的逆缩放作用于激活,因此在引入舍入误差之前,原始线性运算保持等价。
AWQ 的精度一定优于 GPTQ 吗?
不一定。AWQ 与 GPTQ 采用不同方式优化权重量化,没有跨模型和跨任务的固定质量优势。应从相同基线生成制品,保持 Tokenizer、Chat Template、校准数据、工作负载与质量门禁一致后再比较。
AWQ 一定能加速推理吗?
只有运行时和硬件具备匹配制品精确打包布局的高效内核时,权重流量下降才可能转化为加速。反量化、算子回退、小 Batch、KV Cache 压力或重打包都可能抵消收益,应分别测量 TTFT、Token 间延迟、吞吐和 Goodput。
AWQ 需要多少校准数据?
不存在通用样本数量。校准集需要代表生产语言、领域、Prompt 长度、工具调用和敏感任务切片。团队应记录数据集 Revision、采样策略与校验和,并验证所选缩放参数是否稳定、下游行为是否保持。
哪些运行时支持 AWQ?
兼容性会随运行时版本、模型架构、张量布局、内核和硬件变化。应查看目标运行时当前官方支持矩阵,固定版本,核验实际加载的内核路径,并对精确制品执行基准。能够成功加载不等于生产路径高效或正确。