大模型的推理成本正在以每季度约 47% 的速度往下掉。这是 Epoch AI 最新报告给出的数字,换算成年化大约 13 倍——三年时间,同等性能的价格标签被撕掉了十几次。报告认为这条曲线可能从 2021 年 11 月商业 LLM 推理起步那天就一直挂着,至今没走平。这句话里最容易被略过的是"同等性能"四个字:它衡量的不是某个模型贵不贵,而是"把某道题做到某个分数"这件事本身要花多少钱。
"每季度 47%"这个斜率有多陡
为什么起点定在 2021 年 11 月
在那之前,跑大模型基本是研究机构的自娱自乐。没有稳定的按量计费,也就不存在真正意义上的"价格",成本只能靠论文里的训练开销去猜。商业 LLM 推理上线之后,每一次 API 调用都对应一张账单,成本才第一次变成可以按季度追踪的曲线。Epoch AI 选的这个起点,就是账单开始存在的时刻。
一年十三倍到底意味着什么
按季度降 47% 听上去只是个百分比,复利却是残忍的。价格每季度乘 0.53,连乘四次只剩原来的 7.9%,倒过来就是 13 倍的差距。2023 年初花一千美元能跑完的活,理论上三年后不到一美元就能跑完同等量。这个类比当然粗糙——真实世界里你不可能原样重复三年前的任务——但曲线的陡度是实打实的。它不是某家厂商搞促销,是效率本身在变。
"同等性能"才是真正的尺子
很多人会把这类报告读成"模型越来越便宜"。不完全是。同一代模型的 API 报价当然在降,可那是可以被商业决策人为调控的东西,今天降 50% 明天也能涨回去。Epoch AI 量的是另一件事:在某个基准上拿某个分数,需要付多少钱。分数焊死,看价格怎么飘。这把尺子把技术效率和市场定价拆开了,剩下的才是干净的那部分。
两条曲线,别混着读
刚够到 SOTA 的那一段,陡得吓人
报告把曲线切成了两段。第一段是"刚刚追平当时最强水平",这个位置上的成本每季度下降 66%。0.34 连乘四次,一年就是七十多倍。去年需要动用全套工程资源才能勉强摸到的成绩,今年一个预算紧张的团队就能复现。这一段降得最狠,因为它降的主要是"摸索成本"——哪些技巧有用、哪种推理栈跑得通,一旦有人趟过一遍,后来者就省下了全部试错开销。
两年之后,坡度为什么只剩一半
第二段是同一条水平线维持两年之后,降幅放缓到每季度 32%,一年下来大约便宜 4.7 倍。还是很快,但已经不是同一种快法。道理不难猜:刚成为 SOTA 的那一刻,最优解往往依赖昂贵的特定技巧、特定硬件、特定堆料方式;两年时间足够这些东西被吃透、被重写、被塞进更通用的推理框架。剩下没被削掉的那部分成本,才是真正硬的那部分。
五个基准,三类考卷
数据覆盖数学、硬科学和技能游戏三类,共五个基准。这个组合是有心思的:数学考严密推导,硬科学考领域知识叠加推理,技能游戏考长链条决策。三类都不依赖开放式写作那种模糊评判,分数能算得清清楚楚,成本才有意义。换成对话质量或者创意写作,这套测算根本做不起来——你没法给"这段回答更有灵气"标价。
数字漂亮,问题也漂亮
针对性训练这颗钉子
报告自己点出的第一个局限,是有模型可能专门针对这些基准做过训练。一旦发生这种事,成本下降就掺了水——不是通用推理变便宜了,只是"在这张卷子上考高分"变便宜了。说得再直白些,曲线的一部分斜率可能来自应试技巧,而不是真正的智能效率。这是所有基准研究的原罪,把它摆到台面上,比藏在附录里强得多。
数据不完整,结论还有多少弹性
第二个局限是数据不完整。三年里有多少模型、多少个价格点没被记录,报告没有回避。这意味着 47% 是一个估计值,不是一次精确测量,它应该被质疑,也经得起被质疑。真正值得琢磨的是弹性有多大:就算把区间上下各放大十个百分点,"每季度接近腰斩"这个量级依然站得住。这才是报告真正想传递的东西,而不是小数点后那一位。
把代码和数字都放到 GitHub 上
还有一点值得单独拎出来说:数据和代码都公开了。在一个充斥着二手转述和营销话术的领域,这等于把刀递给反对者。你完全可以换一组基准、换一个时间窗口、换一套成本口径,自己跑一遍,看看结论会不会塌。愿意接受这种检验的研究,通常比只发一张漂亮折线图的报告更值得花时间读。
思考变便宜之后
便宜不等于人人都用得起
成本往下走,受益的不会只有大厂。真正的变化发生在边际上:那些过去因为"跑一次太贵"而被砍掉的想法,现在可以重新捡回来算一遍。小团队做不起的大规模评测,现在做得起;研究者不敢碰的长链条推理,现在敢碰。价格曲线的意义从来不在头部,而在那些原本被价格挡在门外的人。
价格曲线和能力曲线,是两件事
别把这两条线搅在一起看。能力在涨,价格在跌,两件事同时发生,但各有各的斜率,各有各的瓶颈。推理成本一年降十三倍,不代表明年的模型会比今年聪明十三倍——它代表的是,同样的聪明,会便宜十三倍。这个区别直接决定你该什么时候下注:赌"更便宜的今天",那就现在;赌"更强的明天",那就还得再等等,并且准备好为等待付溢价。
Epoch AI 这份报告最大的价值,也许不是那个 47%,而是它把"同等性能"这四个字写得足够清楚,然后让所有人拿着它来拆。

