Hugging Face Blog 发布于 08/25 19:39

Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original

(翻译)量化感知修复:性能超越全精度原版的压缩 4 比特模型

查看原文

资讯摘要

A Blog post by Multiverse Computing on Hugging Face

AI 摘要

Multiverse Computing提出量化感知修复(QAH)方法,用于恢复经结构压缩和4比特量化的大模型。它直接以原始未压缩模型为教师,通过KL散度蒸馏学生模型,而非从已恢复的检查点蒸馏。在将GPT-OSS 120B压缩至60B并量化为MXFP4后,模型在9项基准中7项超过自身bfloat16版本,且训练更快、更稳定,显著降低部署成本。

AI 问答

QAH 与常见的 QAT 有何不同?

QAH 从原始未压缩的全精度模型蒸馏学生,而不是像 QAT 那样在量化模型上继续用任务损失微调;KL 散度蒸馏使训练更稳定,达到峰值后不会出现 QAT 那样的能力崩塌。

QAH 模型在哪些基准上超过了原版?

在将 GPT-OSS 120B 压缩到 60B 并量化为 MXFP4 后,QAH 模型在 9 项基准的 7 项上超过自身 bfloat16 版本,还在 LiveCodeBench 上超过了 120B 教师模型。

QAH 的实际部署优势是什么?

4 比特 QAH 模型的权重内存约为 bfloat16 版本的 1/4,参数为教师的 1/2,可在更小硬件上运行;同时无需像 QAT 那样严格早停,训练充分后也能安全部署。

打开原文