QAH 与常见的 QAT 有何不同?
QAH 从原始未压缩的全精度模型蒸馏学生,而不是像 QAT 那样在量化模型上继续用任务损失微调;KL 散度蒸馏使训练更稳定,达到峰值后不会出现 QAT 那样的能力崩塌。
(翻译)量化感知修复:性能超越全精度原版的压缩 4 比特模型

A Blog post by Multiverse Computing on Hugging Face
Multiverse Computing提出量化感知修复(QAH)方法,用于恢复经结构压缩和4比特量化的大模型。它直接以原始未压缩模型为教师,通过KL散度蒸馏学生模型,而非从已恢复的检查点蒸馏。在将GPT-OSS 120B压缩至60B并量化为MXFP4后,模型在9项基准中7项超过自身bfloat16版本,且训练更快、更稳定,显著降低部署成本。
QAH 从原始未压缩的全精度模型蒸馏学生,而不是像 QAT 那样在量化模型上继续用任务损失微调;KL 散度蒸馏使训练更稳定,达到峰值后不会出现 QAT 那样的能力崩塌。
在将 GPT-OSS 120B 压缩到 60B 并量化为 MXFP4 后,QAH 模型在 9 项基准的 7 项上超过自身 bfloat16 版本,还在 LiveCodeBench 上超过了 120B 教师模型。
4 比特 QAH 模型的权重内存约为 bfloat16 版本的 1/4,参数为教师的 1/2,可在更小硬件上运行;同时无需像 QAT 那样严格早停,训练充分后也能安全部署。