据Hugging Face博客9月3日刊文,研究团队发布多语言多模态编码器NeoMME。该模型不使用独立的预训练视觉塔或因果语言模型,而是让单个双向Transformer同时处理文本和原始图像块,并从零训练整个模型。NeoMME包含260M和800M两种参数规模,在视觉文档检索中实现了更高的吞吐量和更低的索引存储开销。
NeoMME的图像与文本共享同一条计算路径。文本输入采用因子化标记嵌入,图像则划分为不重叠的32×32像素块,经小型MLP投影后进入编码器。图像保持原始宽高比和分辨率,使模型对高分辨率文档页使用更多token。两种模型均支持16384 token上下文,可容纳两张4K图片。编码器大部分层采用对称滑动窗口注意力,每六层及最后一层使用全局注意力,并结合分组查询注意力、查询键归一化、门控注意力、二维旋转位置嵌入和平方ReLU MLP等现代改进。分词器是在多语言文本、代码、数学和机器生成的图像描述上从头训练得到的,词表大小为131k。
预训练采用掩码离散扩散目标。对于文本,按0到1之间均匀采样的掩蔽率遮盖token;对于多模态样本,掩蔽率在0.3到1之间,图像块保持可见,模型从剩余文本和图像中重建被掩蔽的文本。高掩蔽率迫使模型学习图像描述,而低掩蔽率则可通过上下文补全。预训练数据混合多语言文本、代码、数学、自然图像和文档图像,每个模型处理约5240亿个打包token,其中文本示例约2900亿token。团队选用NorMuon优化器以提高数据效率。
为评估骨干模型的实际能力,团队用ColPali的页面图像方法将其微调为视觉文档检索器。NeoMME-Retriever在一次前向中同时输出稠密和晚期交互嵌入。在ViDoRe v3基准上,两种尺寸均位于nDCG@10与模型规模的帕累托前沿。在NVIDIA L40S GPU上,以匹配的2048×2048图像输入,260M模型每秒可编码约51页,约为ModernVBERT吞吐量的两倍。层级token池化和非对称量化使晚期交互索引存储从每页约1.5MB降至6kB,缩小255倍,同时保留超过95%的基线nDCG@10。
NeoMME的模型权重以Apache 2.0许可证发布,并已集成到Hugging Face Transformers中。团队指出,近期许多视觉文档检索器基于预训练生成式视觉语言模型构建,但检索、分类和token标记不需要自回归解码,NeoMME的设计避免了随之而来的参数和计算开销。