BM25 在大规模语料中胜出:检索增强生成范式的规模扩展研究

发布时间: 2026-07-31 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

BM25干掉了RAG界的各路神仙。你没看错,就是那个诞生于上世纪、不用GPU、不碰神经网络、看起来像化石一样的词法检索算法。一项刚刚刊出的受控研究把稠密检索、图检索、Agent搜索和BM25拉到同一片擂台上,在整整28个严格嵌套的语料规模层级、横跨约450倍的跨度里一对一掰手腕,结果出奇得让人不得不放下对“智能”的执念:赢家不是最聪明的那个,而是和数据体量最匹配的那个。而一旦语料突破某个临界点,BM25就开始不讲武德地统治全场,全规模优势逼近20个点,甚至画出了一条完全不需要大语言模型参与的低成本帕累托前沿。

一场把RAG范式剥光的规模暴力测试

实验室里,所有选手被扔进28道关隘

这份研究最狠的地方在于它没有给任何技术留面子。研究团队没有像行业里常见的对比实验那样,挑两三个规模点、跑几个基准就下结论。他们硬生生搭建了一个从极小语料到超大语料的频谱,最低层级只有几万token,最高层级直接拉到千万级,总跨度达到450倍,而且每个层级之间的语料规模按照严格的倍数关系嵌套递增——28个层级,一个都不少。这相当于把RAG的各种范式放进了一个精密控制的压力锅里,从微压到高压,一步一步观察谁先崩溃、谁突然爆发。参赛的选手也覆盖了当前RAG架设中几乎所有的典型路径:传统的BM25词法检索,基于嵌入向量的稠密检索,引入知识图谱结构的图检索,以及最近被吹上天的File-System Agent智能代理方案。一句话,你想得到的主流RAG范式,全都在这个竞技场里裸奔了一回。

没有绝对王者,只有规模说了算

结果呢?第一个耳光就扇在了“终极检索器”的幻觉上。实验证明,根本不存在一个在所有规模下都能称霸的方案。每一种检索范式的表现都随着语料体积的膨胀而发生剧烈漂移,而且漂移的方向各不相同。小规模下领先的选手,到了大规模可能掉队掉得连影子都看不见;反过来,那些在小数据上被嘲笑的“笨办法”,越过某个体量之后反而越来越凶。这种规模依赖的交叉点彻底打破了RAG技术选型中普遍存在的刻板印象——简单地说,脱离语料具体规模去谈哪种检索器更好,约等于耍流氓。如果你手里的私有知识库才刚刚搭建起来,只有几十万token的文档,那你眼里的“最优解”跟你把文档库喂到几千万token后看到的“最优解”,几乎注定是两种完全不同的东西。

一千万token,整个战场被重新洗牌

小尺寸下的风光,说塌就塌

在最开始那几个语料极少、几乎可以塞进一个超短上下文窗口的层级里,File-System Agent的确抢到了身位。它能调度工具、能拆解指令、能用LLM的推理能力弥合小语料中信息密度不足的缺陷,看起来又优雅又聪明。可一旦语料开始加速膨胀,Agent的护城河就以一种非常不体面的速度干涸了。大约在1000万token这个量级,转折来得毫无征兆却又极其冷酷:BM25不仅反超了File-System Agent,而且反超的幅度一点也不客气。研究数据显示,BM25在1000万token及以上的所有更大规模层级中牢牢咬着领先位置,再也没有松口。而Agent方案在语料越过临界体积后,其相对效果就像踩了急刹车,先前靠推理兜底的那一套,在庞大文本矩阵面前被摊薄得不成样子。

BM25凭什么在庞然大物面前翻身

很多人想不通:一个连词向量都不懂的词法匹配器,凭什么在大规模语料上把那些动辄调用几亿参数模型的检索器打得满地找牙?答案藏在检索问题的一个反直觉属性里——当语料足够大,相关信号本身会变稠密,而词的直接匹配在这一尺度下反而成了最高效的过滤机制。稠密检索确实擅长捕捉语义相近但措辞不同的内容,但当文档数量膨胀到千万token级别,语义相近的噪音同样被指数级放大,召回里混入的干扰项多到让下游生成模型开始胡言乱语。BM25此时凭借极其严格的词项匹配,天然剪掉了大量“看起来相关但其实跑题”的软关联,反而让检索精度出现了逆势上扬。

近20个点的全规模优势,不是闹着玩的

这份研究最震撼人心的数字莫过于此:BM25在跨越所有规模的全域平均表现上,领先优势接近20个百分点。它不是险胜,是碾压。如果你长期浸在RAG工程一线,你会明白20个点在检索增强生成链路里意味着什么——那不只是排行榜上的一个数字,而是生成质量从“勉强能用”到“直接上线”的差距。而且别忘了,这是在完全不计Agent额外推理开销、不计稠密检索的向量化和索引成本的前提下进行的公平对照。BM25甚至连GPU都不需要,只靠CPU跑倒排索引就拿下了这个成绩。

Agent困在推理里,BM25锚定了无需LLM的低成本前沿

当Agent的武器变成它的负重

File-System Agent在实验中的尴尬遭遇,其实是整个Agent化搜索路线的一个缩影。Agent方案的核心逻辑是用LLM的动态推理替代静态的检索策略,理论上在小规模、高复杂度的任务里相当迷人。但一旦文档规模上来,Agent就必须在成千上万个候选片段之间反复计划、拆解、验证,调用链越长,响应延迟和计算消耗越像滚雪球,更可怕的是推理幻觉会随着调用深度的增加而不断放大。在这次跨越450倍规模的对照里,Agent的表现清楚表明:当语料本身的体量足以覆盖绝大多数问询的信息需求时,过度的推理非但不是加分项,反而变成了拖累检索效率的累赘。

一条完全不要LLM的帕累托前沿

文章第二个让人不得不正视的结论,是关于成本的。BM25不仅效果能打,更关键的是它从头到尾根本不依赖大语言模型来构建检索器。这意味着,在很多RAG场景下,你完全可以先把昂贵的LLM调用砍掉,用BM25锚定的低成本基线来构建第一版系统,再根据真实线上反馈决定要不要把预算砸进更复杂的检索方案里。研究人员甚至在实验中直接画出了一条帕累托前沿——BM25死死咬住低资源、高回报的那个角点,表明在此之上的所有额外投入,无论是换成稠密检索还是叠加Agent链路,换回来的边际收益都被急剧摊薄。这等于给了全行业一个清晰到刺眼的信号:在没有把BM25基线跑透之前,盲目上马任何更“高级”的RAG检索模块,都只是在烧钱做实验。

RAG技术选型的底层逻辑,该推倒重来了

别再神话“越新越强”的线性叙事

回看过去两年RAG领域的演进路径,从单纯的嵌入检索到混合检索,再到Agent化、图神经网络化,整个领域几乎被一种“加复杂度就是加性能”的叙事拖着走。这篇论文最锋利的一刀,就是把这个线性进步的故事拦腰斩断。它用无可辩驳的规模对照实验告诉我们:RAG检索范式的优劣不是技术代际的排列,而是语料规模的函数。你的文档库今天可能只有500万token,Agent方案跑起来体面又得体,但只要业务继续增长、数据持续灌入,当语料规模悄然滑过1000万token的临界点,当初那个被你鄙视的BM25基线就会以沉默且暴烈的姿态把你的新系统按在地上摩擦。这种“规模反转效应”在真实企业场景里极易被忽略,因为大多数团队的RAG评测从未在多个量级上做过纵向拉伸,一个快照式的评测根本看不见未来的陷阱。

先跑通BM25,再谈其他

这篇文章给出的实践建议直接得近乎粗暴:如果你正在构建或迭代一个RAG系统,第一件事不是去比较各种稠密retriever的榜单分数,也不是对着Agent框架挑挑拣拣,而是老老实实在你的真实语料规模上跑一遍BM25。它不仅是效果基准,更是成本预算的锚点。在BM25基线没有彻底饱和之前,任何试图靠堆砌模型复杂度来换取检索增益的企图,都极有可能跌入高投入低回报的深坑。而对于那些语料早已迈过千万token门槛的团队来说,或许翻开旧工具箱、重新拥抱词法检索,才是今年最务实的架构决策。RAG的世界里,没有永恒的王者,只有永远在变大的数据。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 79

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线