OpenRouter 上线了 Batch API,把异步批量请求做成了标准化产品:请求提交后由供应商在 24 小时窗口内跑完,价格通常是正常 per-token 计费的 50%,甚至更低,目前覆盖 70 多个模型。
折扣不是重点,24 小时这个窗口才是。它意味着你不必盯着延迟,只需要盯着 deadline。beta 期间已经跑过 23 万多个批次,官方顺带提示了一件很实在的事:提交时段会影响完成速度——高峰期挤进去的批次,排队概率自然更高。这套逻辑决定了它适合什么:数据标注、离线评测、批量内容生成、历史日志回填,这些任务晚几个小时出结果无所谓,省下一半钱很划算。至于实时对话、Agent 循环、需要多轮工具调用的场景,Batch API 帮不上忙。
50% 的批处理折扣本身不新鲜,OpenAI、Anthropic 早就在卖。OpenRouter 真正的卖点是聚合层:一个端点、一套鉴权、一份账单,就能在 70 多个模型之间挑便宜的跑。对已经在做推理成本优化的团队来说,这不是新能力,而是把原本要写三套适配代码的活儿压缩成一次调用。值得一试,尤其是在你每个月都为 token 账单头疼的时候。

