AI工具AI评分 一般 (57)AI 中文改写

LFM2.5-VL-3B:边缘端更优更快视觉能力

2 小时前 2 阅读来源:HuggingFace Blog

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

LiquidAI发布LFM2.5-VL-3B:3B级视觉语言模型,专攻边缘设备实时理解 LiquidAI近日发布了其最新的视觉语言模型LFM2.5-VL-3B,官方称这是目前能在用户自有硬件上运行的最强视觉语言模型。该模型不仅能够理解文档和屏幕截图,还具备物体定位(Grounding)和工具调用能力,并且采用直接回答而非逐步推理的方式,以保障在实时和端侧应用中的响应速度。从基准测试数据来看,这款3.1B参数的模型在屏幕理解(ScreenSpot-v2)和物体定位(RefCOCO)等任务上,大幅超越了同尺寸竞品,甚至在某些项目上比肩或超过5B、8B的更大模型。 LFM2.5-VL-3B的发布,核心目标是解决边缘设备上视觉AI的痛点。此前,在手机、嵌入式设备或本地服务器上运行视觉模型,往往面临“看得懂但反应慢”或“反应快但识别差”的困境。LiquidAI此次在训练上做了针对性调整:模型采用了SigLIP2 400M视觉编码器,并搭配了与自家LFM2.5-2.6B文本模型相同的预训练主干,在约34T token的数据上预训练,其中视觉数据量是上一代的4倍。为了支持非拉丁语系(如中文),团队还将词表扩充至128K。后训练阶段则采用两段式:先通过知识蒸馏和“Antidoom”训练进行监督微调,再进行多奖励强化学习。这一系列操作带来的直接结果是,在文档理解(DocVQA达91.1)、图表解析(ChartQA达81.3)和屏幕UI元素识别(桌面端78.7、移动端81.2、网页端82.2)上,该模型均处于3B级别的领先地位,相比前代LFM2-VL-3B在屏幕理解上实现了从个位数到80分以上的跨越式提升。 对于跨境电商卖家和AI应用开发者而言,这款模型的价值在于“本地化”和“实时性”。以往处理商品图片描述、多语言文档识别或自动化UI操作,往往需要调用云端API,存在延迟和隐私风险。LFM2.5-VL-3B的尺寸(3.1B)意味着它可以部署在消费级GPU甚至部分高端移动设备上,实现离线处理。例如,卖家可以用它批量识别多语言的产品说明书或竞品页面截图,自动提取关键信息;或者构建本地化的智能客服工具,直接理解用户上传的截图并调用相应软件功能。此外,其多图像输入能力的提升,也为对比不同供应商的报价单或质检图片提供了更准确的判断基础。不过,值得注意的是,在部分纯文本推理基准(如MMMU-Pro)上,该模型仍略逊于Qwen3.5-4B等竞品,说明其在复杂逻辑推理上仍有提升空间,开发者需根据具体场景权衡使用。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · HuggingFace Blog

内容版权归原作者及 HuggingFace Blog 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容