模型路由器听起来像个省钱小技巧,LangChain 却把它当成架构问题来解。他们在开源编码 Agent Open SWE 内部直接塞进路由层,让每一次任务分派先决定该由哪个模型来干。973 个线程的 A/B 测试跑下来,中位成本从 2.61 美元掉到 0.94 美元,降幅 64%,而 PR 合并率反而从 27.3% 升到 29.2%。质量没有可测量的变化,这句话才是重点。
为什么不干脆全线换便宜模型?因为编码任务从来不是均质的。有人只改一行配置,有人要跨十几个文件重构调用链。前者动用大模型是纯浪费,后者交给便宜模型只会反复返工,最后账单更贵。路由要做的判断,是任务进入 harness 的那一刻就估出难度和上下文规模,再决定派谁上场。省下的钱来自"不必每次都拔出最贵的那把刀",而不是把刀换钝。
这件事的信号价值大于数字本身。Agent 的成本结构里模型调用占大头,多数团队却还在单模型打天下,要么贵要么差。LangChain 把路由做进 harness 而非外挂一层网关,意味着模型选择成了运行时的一部分,能拿到完整任务上下文,比只看 token 数的网关式粗放路由准得多。64% 的降幅摆在眼前,接下来该问的不是要不要做路由,而是你的路由凭什么做判断。

