Nunchaku Lite 与原始 Nunchaku 引擎有什么不同?
Nunchaku Lite 是 Diffusers 中的新集成路径,无需自定义 pipeline 或单独推理引擎,可直接加载 Nunchaku 风格检查点;相比原始 Nunchaku 引擎,没有架构专属融合内核,速度提升约 30%,但显存节省水平相同。
(翻译)将 Nunchaku 4-bit 扩散推理引入 Diffusers
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Hugging Face 宣布 Diffusers 现支持 Nunchaku Lite 4-bit 扩散推理,可直接加载 SVDQuant 量化检查点,无需自定义流水线或本地 CUDA 编译。基于 W4A4 量化与融合内核,可在 Blackwell GPU 上实现约 30% 加速,结合 torch.compile 可达 1.8 倍,并最高节省约 50% 显存。
Nunchaku Lite 是 Diffusers 中的新集成路径,无需自定义 pipeline 或单独推理引擎,可直接加载 Nunchaku 风格检查点;相比原始 Nunchaku 引擎,没有架构专属融合内核,速度提升约 30%,但显存节省水平相同。
NVFP4 检查点需要 NVIDIA Blackwell GPU(RTX 50 系列、RTX PRO 6000、B200)。更早的 GPU 应使用 INT4 变体。
可配合 torch.compile、bitsandbytes NF4 量化文本编码器、CPU offload 等优化,进一步提升推理速度并降低显存占用。