AI评分 一般 (57)AI 中文改写
NeoMME:高效多模态原生多语言编码器
3 天前 2 阅读来源:HuggingFace Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
NeoMME发布:一个抛弃视觉塔和因果解码器的多模态编码器,检索效率翻倍
HuggingFace团队近日发布了一款名为NeoMME的新型多模态编码器,提供260M和800M两种参数规模。与当前主流做法不同,NeoMME没有沿用“预训练视觉塔+投影层+因果语言模型”的VLM架构,而是让一个双向Transformer同时处理文本token和原始图像patch,完全从零训练,采用掩码离散扩散目标。该模型已集成到HuggingFace Transformers中,全部checkpoint以Apache 2.0协议开源。
为什么还要做多模态编码器?这要从视觉文档检索的现状说起。目前很多视觉文档检索器都是从预训练生成式VLM改造而来:先用单独的视觉编码器提取图像特征,再通过投影层映射到语言模型的输入空间,最后由因果解码器处理图文混合表征。但检索、分类、token标注这类任务并不需要自回归生成文本,因果解码器带来的参数和计算开销其实是浪费。ModernBERT在双向编码器上带来了架构和训练效率的提升,ModernVBERT则尝试将ModernBERT风格的双向文本编码器与SigLIP2视觉塔结合,但仍保留了独立的预训练视觉塔。NeoMME的团队想更进一步——彻底摆脱VLM的参数和计算负担,设计一个真正原生的多模态编码器。
NeoMME的核心创新在于图像和文本走同一条计算路径,没有预训练视觉塔、文本编码器或解码器。文本输入使用因子化token嵌入,图像则被切分为32×32的非重叠patch网格,通过一个小型MLP投影后与文本token一起进入同一个Transformer编码器。图像保持原始宽高比和尺寸,这意味着高分辨率、信息密集的文档页面会获得更多token,而内容较少的小图则占用更少资源。模型上下文长度达16,384个token,足以容纳两张标准4K UHD图像。大多数层使用对称滑动窗口注意力,每六层和最后一层使用全局注意力,同时集成了分组查询注意力、查询键归一化、门控注意力、2D旋转位置嵌入和squared-ReLU MLP等现代编码器改进。
在性能上,NeoMME的亮点相当突出。团队使用ColPali的页面图像方法对NeoMME进行了视觉文档检索微调,NeoMME-Retriever一次前向传播即可返回稠密和晚期交互嵌入。在ViDoRe v3基准上,两种模型规模都位于nDCG@10与模型大小的Pareto前沿。在NVIDIA L40S GPU上,输入2048×2048图像时,260M模型每秒可编码约51页,吞吐量约为ModernVBERT的两倍。更令人关注的是存储优化:通过分层token池化和非对称量化,晚期交互索引存储从每页约1.5MB压缩到6kB,缩小255倍,同时保留了超过95%的基线nDCG@10性能。
对于做跨境电商和出海业务的团队来说,NeoMME的实际价值在于:如果你正在构建多语言产品目录搜索、文档比对或视觉RAG系统,这个模型能以更低的推理成本获得更高的吞吐量,而且Apache 2.0协议意味着可以自由商用。目前HuggingFace已放出技术报告和视觉RAG演示,感兴趣的开发者可以直接上手测试。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
