AI工具AI评分 一般 (67)AI 中文改写

Transformers现已支持llama.cpp量化

2 天前 2 阅读来源:HuggingFace Blog

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

HuggingFace 的 Transformers 库正式支持直接运行 GGUF 格式的量化模型,这意味着开发者可以用自己笔记本的内存跑动大模型,而不必再依赖独立的推理工具。GGUF 是 llama.cpp 团队开发的本地推理格式,Ollama、LM Studio、Jan 等热门本地 AI 工具都基于它构建。此前,用户要在本地跑 GGUF 模型,基本只能通过 llama.cpp 生态的工具,如今在 Transformers 里只需指定 Hub 上的模型 ID 和文件名,用 from_pretrained 就能加载并生成内容。HuggingFace 表示,GGUF 模型在 Hub 上已被下载数百万次,把这条路打通是顺理成章的事。 这次支持的核心思路是复用 llama.cpp 底层的 ggml 计算内核,通过 kernels 库调用,并精简 generate 环节的开销,让性能尽量接近原生 llama.cpp。初期重点放在苹果芯片的本地推理上,先从 Qwen3.5 架构开始支持。GGUF 格式把模型权重、分词器信息和可选的对话模板打包在一个文件里,支持多种量化等级,比如 Q4_K_M 混合了不同张量的精度,大部分权重压到 4 位,敏感层保持更高精度。以 Unsloth 的 Qwen3.5-4B 为例,BF16 原始版本 8.42GB,Q6_K 降到 3.53GB,Q5_K_M 为 3.14GB,Q4_K_M 只有 2.74GB。官方建议从 Q4_K_M 起步,内存充裕再尝试 Q5_K_M 或 Q6_K,更激进的量化能让更大的模型跑起来,但质量损失因模型和任务而异,最好用实际业务场景去评估。对跨境电商卖家和出海开发者来说,这项更新降低了本地跑 AI 的门槛,做商品描述生成、客服话术优化或多语言翻译时,可以直接在 Mac 上测试不同量化版本的效果,不必再为云端 API 调用成本或数据隐私问题纠结。目前该功能需要苹果芯片 Mac、受支持的 PyTorch 版本以及最新版 Transformers,尚未覆盖 Windows 和 Linux 平台。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · HuggingFace Blog

内容版权归原作者及 HuggingFace Blog 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0 条

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容