NVIDIA Technical Blog 发布于 08/18 02:12

Developing Nemotron 3.5 Lightning NVFP4 with QAD Using NVIDIA Model Optimizer

(翻译)使用 NVIDIA Model Optimizer 通过 QAD 开发 Nemotron 3.5 Lightning NVFP4

查看原文

资讯摘要

Teams customize their models to hit their targets for latency, speed, memory, and compute. With the open NVIDIA Nemotron family of models…

AI 摘要

NVIDIA 技术博客介绍如何使用 NVIDIA Model Optimizer,通过量化感知蒸馏(QAD)开发 Nemotron 3.5 Lightning NVFP4 模型。文章详细说明从 PTQ 到 QAD 训练的两阶段流程,包括五种量化配方、训练配置与蒸馏数据选择。该方法将模型从 66GB 压缩至 22GB,并实现最高约 4 倍吞吐提升,同时恢复激进量化带来的精度损失。

AI 问答

QAD 与 PTQ 有何区别?

PTQ 是后训练量化,直接将模型权重量化到低精度;QAD 在此基础上用原始全精度模型作为教师,通过蒸馏损失指导量化学生模型训练,从而恢复激进量化造成的精度损失。

Nemotron 3.5 Lightning NVFP4 的模型大小和吞吐表现如何?

模型从 66GB 的全精度检查点压缩至 22GB,可带来最高约 4 倍的吞吐量提升,同时保持精度。

如何复现该流程?

可使用 NVIDIA Model Optimizer 对 Hugging Face 模型执行 PTQ 量化,再参考端到端 QAD 示例进行蒸馏训练,涉及校准数据、序列长度和量化配方等配置。

打开原文