LFM2.5-2.6B:随处部署本地智能体
1 小时前 2 阅读来源:HuggingFace Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
LiquidAI 推出 LFM2.5-2.6B,一个仅有 26 亿参数的小模型,却能在工具调用、指令遵循和多步智能体任务上匹敌甚至超越体积大 4 倍的模型。该模型专为端侧部署设计,支持在笔记本电脑、手机等日常硬件上运行,推理速度最高可达每秒 220 token,内存占用不到 2.5GB。这意味着开发者可以将 AI 智能体部署到任何设备上,数据完全留在本地,无需承担云端推理费用。
LFM2.5-2.6B 的诞生源于对隐私和成本的双重考量。当前主流智能体模型依赖云端推理,不仅产生持续的费用,还将用户数据暴露给第三方服务。LiquidAI 团队选择了一条不同的路径:让模型足够小、足够快,直接跑在用户设备上。为此,他们在预训练阶段使用了约 34 万亿 token 的数据,并将上下文窗口扩展到 128K。后训练阶段则采用了四阶段策略:先进行两轮监督微调,重点强化工具使用和智能体轨迹数据;然后按领域训练专家教师模型;接着通过多领域策略蒸馏将多个专家合并为一个学生模型;最后在真实的智能体框架内进行多轮强化学习,让模型学会在不同工具、系统提示和多轮任务环境中协作。
从基准测试结果看,LFM2.5-2.6B 在指令遵循和工具使用方面表现尤为突出。在 IFBench、Multi-IF、IFStruct 等指令遵循基准上全部排名第一;在 ToolSandbox 工具使用基准上得分 77.83,远超同体积的 Gemma 系列。在智能体任务上,它击败了 Gemma 系列两个型号,与 Qwen3.5 系列基本持平。不过,在代码生成方面,更大的模型仍然保持明显优势,开发者如果有强编码需求,建议选择更大参数量的模型。
推理性能方面,LFM2.5-2.6B 在 Apple M5 Max 芯片上达到每秒 220 token,在 AMD Ryzen CPU 上也有每秒 113 token 的表现,内存占用低于 2.5GB。发布当天即支持 llama.cpp、MLX、vLLM、SGLang、ONNX 等主流推理框架,方便开发者直接集成。对于跨境电商卖家而言,这类端侧模型意味着可以在本地设备上运行客服机器人、订单处理助手等应用,既保护客户数据隐私,又省去持续的 API 调用成本。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
