搜东西搜不到这件事,有人把整套家底全开源了
现在做 AI 应用的,谁没在搜索召回上吃过苦头。
搭 RAG 流程,召回不对,后面的生成全是白搭。调 Embedding 模型、拼多路召回、试各种 reranker,折腾一圈下来发现,真正好用的模型训练数据都不开源,想自己微调都没门路。这不只是一个人的困境,整个 IR 圈子都卡在这。
今天看到的这篇 arXiv 论文,倒是有点不一样的味道。
Raphaël Sourty 他们搞了两个检索模型——DenseOn(单向量稠密)和 LateOn(ColBERT 风格的延迟交互),参数量 149M,规模不算大,但 BEIR 上 nDCG@10 分别跑到 56.20 和 57.22,在这个参数量级刷了 SOTA。他们把整个训练家底全扔出来了:665M 对比预训练 pairs(从 34 个公开源、1.4B pairs 里淘出来)、1.88M 带 hard negatives 的微调数据、训练代码、模型权重,一样没藏。
这批数据最值得说的,还不是英文效果。他们把英文训练数据翻译成 8 种语言,拼出 2.8B pairs,基于 mmBERT-base 训了 mDenseOn 和 mLateOn,参数量涨到 307M。到这里都还是常规操作。有意思的发现藏在对比里:稠密模型(mDenseOn)在翻译覆盖的语言上表现强,但碰到没见过的语言和文字系统就明显掉分;而延迟交互模型(mLateOn)靠 token 级别的匹配,对没见过的语言泛化得好多。论文里那句话翻译成人话就是——translate-train 对稠密模型是语言扩展的补丁,对延迟交互模型才是真·多语言泛化的训练方法。
这对做多语言 RAG、跨境搜索、代码搜索的人来说,是个好消息。不需要覆盖全世界每种语言的训练数据,用一个 307M 的 LateOn,用翻译数据训完,它能对没见过的语言也做出合理召回。而且 ColBERT 风格的延迟交互在工程上已经比较成熟,向量存储和检索都有现成的轮子。
BEIR 上的 SOTA 要加限定词——"这个参数量级"。拿 149M 跟 7B 的 Embedding 模型比不现实,但反过来,它完全开源、体积可控、多语言泛化经过验证,对于不想被闭源 Embedding API 绑死、想在搜索层自己掌控的开发团队,是一套可以直接落地的选择。
论文、模型、数据、代码都在 arXiv 上挂了。翻到底看到一句话——"state-of-the-art retrieval models increasingly rely on closed training data, creating a reproducibility gap"。翻译过来就是:闭源再搞下去,整个领域都没法玩了。这批人选择不跟着走。
相关链接
- 论文:https://arxiv.org/abs/2607.27178
- PDF:https://arxiv.org/pdf/2607.27178