一个只有260M参数的模型,在视觉文档检索任务上,把存储开销压缩了255倍,同时性能几乎追平了比自己大14倍的对手。这不是实验室里的理想数据,而是NeoMME——一个新推出的模型系列——交出的实际成绩单。
视觉文档检索,简单说就是让AI在大量带文字的图片、扫描件、PDF里找到你想要的内容。过去这类任务基本被两类方案垄断:要么用庞大的生成式视觉语言模型(VLM)硬扛,要么用双塔结构牺牲精度换速度。NeoMME走了一条不同的路——它用单一的双向Transformer,原生同时处理文本和图像,不搞独立视觉塔,也不要因果解码器。
![]()
一个Transformer,两种输入,一次搞定
NeoMME的架构思路很直接:图像被切成不重叠的32×32补丁,通过一个小型MLP投影;文本则用分解式词元嵌入。两者进入同一个Transformer编码器,这个编码器配备了分组查询注意力、2D旋转位置嵌入、门控注意力,以及交替的滑动窗口和全局层。
这种设计的直接好处是省掉了双塔或纯解码器设计的参数和计算开销。模型从头开始预训练,用的是掩码离散扩散目标——具体来说,多模态示例的损坏率在0.3到1.0之间随机变化,高掩码率会迫使模型从图像证据中重建文本,而不是偷懒走纯语言捷径。整个预训练过程处理了约524B的打包词元,其中包含290B纯文本词元,配合NorMuon优化器提升数据效率。
针对下游检索任务,NeoMME-Retriever在单次前向传播中同时返回两种嵌入:用均值池化生成的密集头(兼容ANN索引的紧凑向量),以及生成逐词元向量的延迟交互头(保留局部匹配粒度)。两种结果一次算完,部署时按需取用。
260M参数追平14倍大的对手
在ViDoRe v3基准上,NeoMME-260M取得了0.523的nDCG@10,这是所有严格低于800M参数的模型中的最高分。更关键的是,它和ColQwen2.5的差距只有0.002,但参数量少了约14倍。800M版本则达到0.556,与同等规模的Vultron Retriever Flash仅差0.009。两个版本都位于ViDoRe的帕累托前沿——也就是说,在精度和效率的权衡上,没有其他模型能同时在这两个维度上超过它。
参数效率只是故事的一半。高分辨率下的延迟交互检索,过去有个致命痛点:存储开销太大。NeoMME用两个手段解决这个问题——分层词元池化和非对称量化。池化操作对每页相似的向量聚类,用均值替换;非对称量化把文档嵌入存成int8或二进制,查询嵌入保持更高精度。
效果是惊人的:单页存储从约1.5MB降到39kB,缩小39倍,同时保留超过99%的基准nDCG@10。更激进的配置用池化因子8、int8查询和二进制文档,单页只需6kB——压缩255倍,质量保留率依然超过95%。
速度翻倍,代码全开源
在L40S GPU上处理2048×2048输入时,260M模型的编码速度约为51页/秒,大约是ColModernVBERT的两倍。所有检查点都已通过Hugging Face Transformers以Apache 2.0许可证开源,可以直接上手用。
NeoMME的价值不在于某个单一指标的突破,而在于它证明了:视觉文档检索不一定非要靠大模型硬堆。一个精心设计的统一架构,配合聪明的压缩策略,完全可以在参数少一个数量级的情况下,把性能做到同一梯队,同时把存储和速度的账算得明明白白。
对于需要处理海量文档检索的团队来说,这组数据值得认真算一笔账:省下的存储成本、提升的吞吐量、以及开源带来的灵活性,可能比单纯追求更高精度更有实际意义。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.