据MarkTechPost报道,H Company于9月6日发布NeoMME系列多模态编码器,包含2.6亿和8亿参数两种尺寸。该系列取消了视觉塔和因果解码器,用一个双向Transformer同时处理文本与图像,其检索版本NeoMME-Retriever在ViDoRe v3基准上以260M参数取得0.523的nDCG@10,逼近3.75B参数的ColQwen2.5。
NeoMME采用单塔架构。文本先进行256维嵌入查找,再投影到模型宽度,这是ALBERT风格的因子化嵌入。图像被切成不重叠的32×32补丁,经随机初始化的两层MLP直接映射,无需补丁合并模块或SigLIP2视觉塔。两个模型均支持16384 token上下文,足以容纳两张4K UHD图像。大部分层使用对称滑窗注意力,每第六层和最后一层进行全局注意力,并配置了分组查询注意力、查询键归一化、门控注意力、二维旋转位置编码和平方ReLU激活。
预训练采用离散掩码扩散。文本段的破坏率在0到1之间均匀采样,多模态段的破坏率从0.30到1,这一设置消除了纯文本捷径,迫使模型阅读页面。在90%掩码率下,可见页面补丁使260M和800M模型的掩码token准确率分别提升38.4和40.5个百分点。每个模型处理约5240亿个打包输入token,其中约2900亿个为纯文本token。
NeoMME-Retriever在共享主干上增加两个联合训练的头:一个平均池化密集头(支持Matryoshka尺寸),一个后期交互头(将每个token和补丁映射到128维),一次前向即可获得两种表示。ViDoRe v3测试中,260M模型得分为0.523,800M模型为0.556。260M模型与ColQwen2.5-v0.2(3.75B参数)的成绩仅差0.002,比其它300M以下模型的最高得分高出26.1个百分点;800M模型比同规模的Vultron Retriever Flash低0.9个百分点。纯文本检索结果较弱,BEIR-15上后期交互得分为0.4881和0.5126,低于149M参数LateOn模型的0.5722。作者认为主要原因是监督规模差距:NeoMME用约43万条文本查询示例,而mLateOn有约6.6亿条对比示例。
后期交互索引的存储成本很高。一张2048×2048页面生成4162个向量,在float32格式下每个ViDoRe v3文档约1.5MB。层级token池化和非对称量化可压缩存储:池化因子10配合int8查询和文档,每页降至39.0kB,比基线缩小39.4倍,保留99.16%的nDCG@10;池化因子8配合int8查询和二进制文档,每页降至6.0kB,缩小255.5倍,保留95.19%的nDCG@10。在单张NVIDIA L40S上,NeoMME-260M每秒可编码51.3页,是ColModernVBERT(26.0页/秒)的1.97倍;纯CPU主机上完成一次查询编码需78.3毫秒。
所有检查点以Apache 2.0许可开源,并在发布当天获得Hugging Face Transformers支持。纯文本检索和对冻结自然图像的迁移仍是其明显短板。