OpenRouter 最近上线了一个实时排行榜,把搜索预算这件事从工程直觉变成了可以对比的硬数据。围绕 BrowseComp 基准,不同模型、搜索引擎、搜索方法以及搜索轮数的组合被放在同一张表里,分数和成本一起列出来。很多人以为 AI Agent 的搜索能力就是“挂个搜索引擎”,但这份排行榜把底牌掀开了:搜索预算从 1 轮加到 25 轮,BrowseComp 得分几乎翻倍,而成本只增加 2.5 到 7 倍。这个数字足以让所有做 Agent 的人重新审视自己的配置。
这份榜单到底在测什么
四类变量,拆开看才清楚
过去的 Agent 搜索基准往往只给一个综合分,模型、引擎、搜索方法、预算全部混在一起。开发者拿到分数,还是不知道具体该改哪一个参数。OpenRouter 的做法很直接:把四个变量拆开,分别组合测试。模型是哪个型号,搜索引擎用哪家,搜索方法是什么策略,预算给多少轮,全部都列在排行榜上。这样每一项的影响都能单独比较。
这种拆法不是学术洁癖,而是工程刚需。一个做客服 Agent 的团队和一个做研究助理的团队,对搜索的需求完全不同。如果不把变量分开,任何“最优配置”都是空谈。实时榜单的价值在于,它让同一套代码和同一套任务集下,不同组合的分数和成本直接可比。
BrowseComp 不是普通问答
BrowseComp 考察的是浏览和综合能力,不是简单的“搜索-复制-粘贴”。这类任务往往要求模型从多个网页里提取分散的信息,做交叉验证,甚至要处理矛盾信源。所以搜索轮数的影响会被放大,模型筛选信息的能力也会被放大。
用普通问答基准来评估 Agent 搜索,结果往往看不出明显差距,因为那些任务太简单,单轮搜索就能解决。BrowseComp 更接近真实工作场景里的复杂检索,所以才把预算这个变量逼了出来。
搜索预算成了最划算的杠杆
从 1 轮到 25 轮,分数几乎翻倍
过去大家会把精力放在选模型、挑搜索引擎上,很少有人单独把“搜索轮数”当成一个可以推翻重来的参数。OpenRouter 的榜单把四类变量拆开后,最刺眼的结果就是:在 BrowseComp 任务里,预算从 1 轮提升到 25 轮,得分几乎翻了一倍。这不是小修小补,而是质变。同一个模型、同一个引擎,只是允许它多搜几轮,能力就能上一个台阶。
为什么会这样?因为很多复杂问题不是一次搜索就能定位到答案的。模型需要试错、需要交叉验证、需要从第一轮的结果里发现新的线索。单轮搜索就像只能问一个问题的考试,多轮搜索才是完整的解题过程。那些只给一轮搜索预算的 Agent,本质上是在让模型蒙住眼睛解题。
成本只增 2.5 到 7 倍,这笔账怎么算
如果分数翻倍需要付出几十倍的成本,那很多人会犹豫。但这份榜单给出的成本增量只有 2.5 到 7 倍,性价比极高。尤其对于那些宁可多花一点钱也要把任务做对的场景,比如金融分析、法律检索、科研辅助,这几乎是一笔不用细算的账。
当然,成本增量不是一个固定值,区间浮动意味着不同模型和不同搜索方法的组合会带来不一样的账单。同一个预算档位,有的组合成本只涨两倍多,有的却要七倍。榜单的价值恰恰在于把这种差异摊在明面上,让你不用再靠猜去决定要不要加预算。哪怕只是把预算从 1 轮提到 5 轮,很多任务就能看到明显提升,而成本几乎可以忽略。
模型与引擎的权重重新洗牌
模型选错,引擎再强也救不回来
榜单里另一个反直觉的发现是:模型选择比搜索引擎更重要。平均分差 15 分对 10 分,模型之间的差距明显大于引擎之间的差距。很多人迷信“用最贵的搜索引擎就能提升效果”,但数据并不支持这种直觉。
引擎更像是信息来源的管道,模型决定了信息被加工成答案的质量。管道粗一点当然有帮助,可如果处理信息的脑子不行,再多的搜索结果也只会变成噪音。这份排行榜用分数把这种关系量化了。那些在模型上省钱、却在引擎上堆资源的做法,等于给一个平庸的厨师配了一整套顶级厨具,做出来的菜还是平庸。
平均分差 15 对 10,差距藏不住
15 分和 10 分的差距看起来不大,但在基准测试里,这已经是能否进入第一梯队的区别。尤其在 BrowseComp 这种专门考察浏览和综合能力的任务上,模型的推理、筛选、归纳能力会被放大。搜索引擎只要不是太差,及格线都差不多;模型一旦选弱了,靠引擎补不回来。
这也意味着,团队在预算有限时,优先升级模型可能比换引擎更划算。引擎的选择可以保守,模型的选择必须激进。许多团队长期把引擎当成改进抓手,换了一家又一家,效果却不明显,问题可能根本不在引擎上。榜单把平均分摆出来,就是让人看清楚优先级该放在哪里。
失败率高的任务别再硬堆深度
深度搜索,有时纯属浪费
排行榜还揭示了一个容易被忽略的维度:失败率。有些任务本身成功率就低,这时候增加搜索轮数并不能把失败变成成功,反而会成倍推高成本。OpenRouter 的建议很直接:失败率高的任务应降低搜索深度以控制成本。
这背后的逻辑是:搜索预算的投入和产出并不是线性关系。在一些容易出错或者数据不完整的任务上,多搜几轮可能只是把错误重复几遍。与其这样,不如省下调用次数,把资源留给更有把握的任务。深度搜索不是包治百病的药,有时只是给坏结果加了一层更贵的包装。
动态配置才是正解
固定给所有任务分配同样的搜索轮数,是过去没有数据时的懒办法。现在的实时排行榜让动态配置成为可能:根据任务类型、模型能力、历史成功率,动态决定搜索深度。高把握的任务多给几轮,低把握的任务及时止损。
这听起来简单,做起来需要一套监控和调度的机制。但至少,数据已经把方向指出来了。与其盲目堆预算,不如先看看失败率再决定要不要继续搜。如果能用更少的成本完成大多数任务,把省下的预算花在少数高价值任务上,整体回报反而更高。
实时排行榜背后的开发启示
静态配置该退场了
Agent 搜索的配置不再是“上线前定好就不用管”的事。模型会更新,引擎会调整,搜索方法也在变。OpenRouter 的排行榜是实时的,意味着所有组合的分数和成本都在动态变化。开发团队如果还在用几个月前的配置,很可能已经在暗中吃亏。
把搜索预算、模型、引擎当作可以实时调优的变量,而不是固定参数,这才是榜单给行业最大的提醒。现在的 Agent 开发还在把搜索当成一个静态插件,但数据已经证明,不同配置之间的差距大到足以左右产品竞争力。
基准测试的下一步
BrowseComp 只是起点。这个榜单把搜索预算单独拎出来,已经比很多笼统的“Agent 能力排行”有用得多。下一步或许应该把任务难度分层、把成本与延迟同时纳入,甚至给出不同预算下的最佳组合推荐。
真正有用的基准测试不是给一个排名,而是帮人做出选择。OpenRouter 这次至少把选择依据从拍脑袋变成了看数据。对于整天被“要不要加搜索轮数”“换哪个搜索引擎”之类问题纠缠的开发者来说,这种直接可用的数据比任何模型跑分都值钱。

