据Hugging Face博客,Diffusers库现已支持Nunchaku 4-bit扩散模型推理。用户可以通过from_pretrained()直接加载量化后的检查点,无需使用单独的推理引擎或本地CUDA编译。这一集成使得4-bit量化扩散模型部署门槛大幅降低。
Nunchaku背后的量化方法是SVDQuant,它在4比特权重和激活(W4A4)下运行主要Transformer层,在减少内存的同时加快去噪循环。官方示例显示,一个配备NVFP4 Transformer和bitsandbytes NF4文本编码器的ERNIE-Image-Turbo检查点,在RTX 5090上生成1024×1024图像约需1.7秒,峰值内存约12GB,而BF16版本约需24GB。
新集成路径名为Nunchaku Lite。它通过在模型加载前将Diffusers模型的nn.Linear模块替换为运行时SVDQ/AWQ线性层来实现,CUDA内核通过Hugging Face Hub的kernels包提供。需要注意的是,由于没有针对特定架构的融合内核和模块,Nunchaku Lite的速度提升约为30%,低于原版Nunchaku引擎,但内存减少水平相同。
标准4比特量化对扩散Transformer很困难,因为权重和激活都有大量异常值。SVDQuant通过将激活异常值移入权重,用小的16位低秩分支表示每个权重矩阵中最困难的部分,并将剩余部分量化为4比特。Nunchaku通过融合内核加速4比特路径和低秩分支。
NVFP4检查点需要NVIDIA Blackwell GPU(RTX 50系列、RTX PRO 6000、B200),早期GPU可使用INT4变体。此外,配套的diffuse-compressor工具包允许用户自行量化新架构并发布为常规Diffusers仓库。