AI评分 一般 (64)AI 中文改写
面向边缘计算的多模态开放式d1决策模型
16 小时前 5 阅读来源:HuggingFace Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
LiquidAI 在 HuggingFace 上开源了两款决策模型,d1-3B 和 d1-omni-600M(实验性),主打边缘设备上的多模态快速决策。这两个模型属于其 d1 决策模型家族,和常见的生成式模型不同,它们不逐字生成内容,而是在单次前向传播中直接给出答案。在 Decision Index 0.2.1 榜单上,d1-3B 得分 48.57,成为 100 亿参数以下最强的决策模型,超过了所有 4B 和 9B 级别的模型,也压过了 350 亿参数的 Decider 35B-A3B(47.11)。速度方面,d1-3B 在 NVIDIA Jetson AGX Thor 上回答一个问题只需 16 毫秒,Jetson AGX Orin 上 26 毫秒,Jetson Orin Nano 上 50 毫秒;在 RTX 4090 上更是低至 8 毫秒。
这两款模型的技术路线差异明显。d1-3B 基于 LFM2.5-VL-3B 这个解码器架构的视觉语言模型训练,支持文本和图像输入;d1-omni-600M 则基于 LFM2.5-Encoder-350M 这个双向编码器,额外加入了视觉和音频编码器,可以处理文本加图像或文本加音频两种组合,目前还处于早期研究阶段。在七个公开数据集(涵盖阅读理解、毒性检测、意图分类、医疗问答和跨语言理解)的测试中,d1-3B 平均得分 82.9,是所有对比模型中最高的;d1-omni-600M 以仅四分之一参数量拿到 78.4 分,超过了 Decider 2B 的 77.1 分。对跨境电商卖家和 AI 应用开发者来说,这类模型的意义在于:过去要在边缘设备上跑多模态决策,往往得依赖云端 API 或牺牲响应速度,而 d1 系列把延迟压到了几十毫秒级别,且支持本地部署,适合对数据隐私敏感或网络不稳定的场景,比如仓库端图像质检、客服意图实时分类、多语言评论审核等。模型自带代码,安装 transformers 5.14 以上版本、torch、torchvision 和 pillow 后即可加载使用。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
