AI评分 一般 (62)AI 中文改写

将双节棍4位扩散推理引入扩散器

6 小时前 2 阅读来源:HuggingFace Blog

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

Nunchaku 4-bit 扩散推理正式接入 Diffusers,低显存也能跑高清图 大型扩散 Transformer 模型能生成惊艳的图像、视频甚至音频,但以 BF16 精度加载一个现代文生图模型通常需要 20-30 GB 的显存,这让大多数消费级 GPU 望而却步。量化是解决这一问题的有效手段,Diffusers 此前已集成 bitsandbytes、GGUF、torchao 和 Quanto 等多个量化后端。不过,这些后端大多属于“仅权重量化”,即把权重存为低精度,计算时再解量化回高精度。这虽然显著降低了显存占用,但通常不会加速推理,有时甚至会带来微小的延迟开销。 SVDQuant 是流行推理引擎 Nunchaku 背后的量化方法,它采取了不同的策略。该方法以 4 位权重和 4 位激活(W4A4)运行主要的 Transformer 层,在降低显存的同时还能加速去噪循环。此前,使用这些检查点需要单独的推理库。现在,Diffusers 原生支持 Nunchaku 检查点,加载模型只需调用 `from_pretrained()`,无需本地 CUDA 编译,因为内核已打包在 Hugging Face 的 `kernels` 包中。此外,配套的 `diffuse-compressor` 工具包允许用户自行量化新架构,并将其发布为常规的 Diffusers 仓库。 上手 Nunchaku Lite 非常简单。首先安装依赖:`pip install -U diffusers transformers accelerate kernels bitsandbytes`。然后像加载其他 Diffusers 模型一样加载预量化流水线。例如,使用 `lite-infer/ERNIE-Image-Turbo-nunchaku-lite-nvfp4_r32-bnb4-text-encoder` 检查点,只需几行代码即可生成 1024x1024 的图像。在 RTX 5090 上,生成一张图仅需约 1.7 秒,峰值显存约 12 GB,而 BF16 流水线则需要约 24 GB。需要注意的是,NVFP4 检查点需要 NVIDIA Blackwell GPU(RTX 50 系列、RTX PRO 6000、B200),早期显卡请使用 INT4 变体。 SVDQuant 是 Nunchaku 背后的量化方法,其核心在于处理扩散 Transformer 中的异常值。标准 4 位量化对扩散 Transformer 来说很困难,因为权重和激活中都存在大量异常值。SVDQuant 通过将激活异常值转移到权重中来解决这个问题,用一个小型 16 位低秩分支表示每个权重矩阵中最难的部分,然后将剩余部分量化为 4 位。Nunchaku 通过融合内核加速 4 位路径和转置操作,使这一过程变得高效。对于中国跨境电商卖家来说,这意味着在生成商品图、场景图或营销素材时,可以大幅降低对高端显卡的依赖,用 RTX 4090 甚至 RTX 4060 就能流畅运行高清文生图模型,从而降低硬件成本。对于 AI 工具用户和开发者而言,Diffusers 的原生支持意味着更低的集成门槛,无需再维护独立的推理引擎,可以更专注于应用层的开发。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · HuggingFace Blog

内容版权归原作者及 HuggingFace Blog 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容