选 Agent 模型,最贵的那个往往不是答案。OpenRouter 给出的三步框架足够直白:别盯着排行榜挑最高分,先按任务定一条质量门槛,回头再找能过线的最便宜模型。顺序反了,钱就白花。
第一步,门槛先定死。你的 Agent 到底要干什么,及格线就画在哪,和榜单第一没有半点关系。第二步,掏出 20 到 50 条自己的真实示例,同时喂给廉价、中档和前沿三档模型,用同一套评分标准打分,算出每质量点要花多少钱。这里的关键词是"自己的示例"——公开基准跑得再漂亮,也测不出你的业务长什么样。第三步,挑过线模型里最便宜的那个,但必须留出余量:同一个模型反复跑,分数本身就会上下抖,余量不够,今天压线过关,明天就翻车。
这套逻辑真正推翻的是"分数越高越好"的默认假设。前沿模型多出来的那几分,如果你的任务根本用不上,那就是纯粹多付的钱;廉价模型只要稳定压过门槛,省下来的全是利润。Agent 的成本结构里,模型调用是跑得最凶的一项,选型错一档,规模一上来就被放大成真金白银。所以别问哪个模型最强,问哪个模型刚好够用、又便宜得让人安心。

