资讯

H Company Releases NeoMME: A Family of 260M and 800M Single-Tower Multimodal Encoders That Drop the Vision Tower and Causal Decoder

marktechpost.com·2026/9/6 21:06:41🔗 原文

📋总体概括

H Company发布NeoMME系列多模态编码器,包含260M和800M两个规格,采用单塔双向架构:去掉传统视觉塔和因果解码器,用单个Transformer直接处理多语言文本token和32×32原始图像patch,预训练目标为掩码离散扩散。模型提供稠密与late-interaction双检索头,在ViDoRe v3基准上260M模型达到0.523 nDCG@10,支持255倍索引压缩,单张L40S上索引吞吐达每秒51.3页,但作者承认文本检索能力仍存在差距。

关键信息

  • NeoMME是260M和800M参数的双向编码器家族,单塔架构同时处理多语言文本token和原始32×32图像patch
  • 架构上完全舍弃预训练视觉塔与因果解码器,区别于ColPali式检索器,预训练目标为掩码离散扩散
  • 配备稠密和late-interaction双检索头,260M模型在ViDoRe v3上取得0.523 nDCG@10
  • 工程效率突出:索引压缩达255倍,单张L40S上索引吞吐量为每秒51.3页
  • 作者坦承该模型在纯文本检索任务上仍存在性能差距

🔥犀利点评

去掉视觉塔、丢掉因果解码器,H Company赌的是「检索不需要生成能力」这个判断,用掩码扩散从头训单塔编码器。255倍索引压缩加单卡51.3页/秒的吞吐才是真正卖点——企业级文档检索的成本敏感度远高于基准分数。但260M做到0.523 nDCG@10并不惊艳,且自认文本检索有短板,说明这套架构是明确的取舍而非全能替代,落地价值要看真实语料下的召回成本账。

本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文