模型选型这件事,大多数团队搞复杂了。OpenRouter 最近发布的一套框架,把矛头直指一个惯性思维:盯着 token 单价,等于只看菜单不看账单。真正该算的账,是每一单实际交付要花多少钱——那才是人工智能开销的核心。
别把 token 价格当成本
每完成一次任务,成本才有意义
我们习惯在模型对比表里看每百万 token 的报价,然后得出结论:这个便宜,那个贵。但 OpenRouter 提出的判断标准是“每完成任务的成本”而非“每 token 成本”。这就像比出租车,不能只看起步价,要看最终到目的地收多少钱。
一个简单的例子:模型 A 的 token 单价低,但回答复杂问题时容易出错,需要多次重试;模型 B 单价略高,却一次就能给出可用结果。算总账,模型 B 反而便宜。把“任务完成”作为计费单位,才贴近真实业务。
失败率和重试,是隐藏的账单
重试意味着同样的输入要再次交给模型,输出也要重新生成,消耗翻倍。更麻烦的是,失败还会推高延迟,伤害用户体验。OpenRouter 刻意把实时用量和第三方基准放在一起,就是要让团队看到:基准测试里的高分,到了真实流量中可能因为超时、拒绝响应而变成废分。
实时用量,校正基准偏差
静态基准有它的价值,但基准题目终究不是你的数据。实时用量能反映模型在生产环境中的真实表现,包括负载高峰期的响应速度、不同输入分布下的稳定性。两相对照,能筛掉不少“纸面强者”。
一套四步走的选择框架
先给任务下定义,别急着翻榜单
选模型之前先问自己:我要让模型做什么?是改写一段文案,还是从合同里抽取结构化字段?是复杂多步推理,还是低延迟的客服问答?任务的性质直接决定候选池的大小。把任务定义清楚,后续所有比较才有参照物。
筛选候选:用基准和实时用量双重过滤
定义好任务后,把满足基本能力的模型拉进候选列表。OpenRouter 建议从实时用量和第三方基准中筛选:基准给出理论预期,实时用量给出实战数据。两层过滤后,剩下的模型通常不超过三到五个,再进入下一环节。
最终裁判,是你自己的提示词
别迷信任何公开分数。把你业务里最典型、最刁钻的提示词拿出来,分别跑这几个候选模型,同时记录输出质量、响应时间、重试次数。跑完一轮,用“每完成任务的成本”统一计算,谁好谁坏一目了然。这一步最容易偷懒,也最不该偷懒。
工具链让选型变成实时操作
打开编辑器就能查排名
OpenRouter 做了一个 MCP 服务器,直接接进 Claude Code、Cursor 这类编辑器。不用离开编码环境,就能查询模型的实时排名、价格、基准数据。选型从“季度评审”变成“随手操作”,这改变的不只是便利性,更是决策频率。
auto-beta:让请求替你做选择
对拿不准要不要上新的模型的团队,OpenRouter 的 openrouter/auto-beta 功能很有意思:它按请求路由,自动把一部分流量分给 beta 模型。这相当于在线上灰度测试模型,用真实压力验证效果。等数据攒够,再去决定要不要全量切换。
选型不是一次性动作,而是持续循环
模型市场每个月都有新版本,之前的最优解可能很快就过时。有了实时查询和路由工具,选型可以做成一个持续循环:定义任务、跑测试、看数据、调整路由。每次任务请求都在产生数据,也在帮团队校准决策。
选型之后:动态路由与生态思考
成本核算的颗粒度正在改变
过去我们说“这个模型便宜”,指的是它的 token 单价低。现在,更准确的表达是“这个模型完成这类任务的成本低”。颗粒度从 token 下沉到任务,团队的经济学模型也跟着变。预算审批可以按任务量估算,而不是拍脑袋算 token 消耗。
一个可量化的“模型经济学”指标
我建议每个团队都给自己定义一个核心指标:平均每次任务花费,其中包含重试、失败、超时导致的各种浪费。这个数字直接反映了模型与业务场景的匹配度。OpenRouter 这套框架的价值,正是把这种比较从口口相传的直觉,变成可量化、可复用的方法论。

