GPT-5.6 没有把力气花在单纯刷榜上。它做了一件更让开发者睡不着觉的事:把前沿级智能体性能的成本线,直接砍到了原来的二十五分之一。这次更新的真正主角不是某个基准测试的数字,而是推理持久化、原生多智能体编排和程序化工具调用这三组 API 原语。对长期在 token 成本和推理深度之间走钢丝的团队来说,这些原语比模型参数更重要。
新原语:不是模型升级,是接口层发生位移
GPT-5.6 家族的出现,表面上是模型能力的又一次迭代。但如果只盯着 ARC-AGI-3 或 BrowseComp 的分数,很容易错过真正的变化。这次更新把智能体应用中原来靠应用层拼装的机制,下放到了 API 层。开发者不再需要为每一轮推理手工保存状态,也不再需要靠外部框架硬凑多个智能体之间的交接。
推理持久化,给智能体装上“工作记忆”
过去做大模型智能体最头疼的问题之一,是每个会话都像一个失忆的人。前端交互、工具调用和长任务推进,全靠开发者自己维护状态。GPT-5.6 的推理持久化能力直接把这个负担接了过去。它允许模型在长时间任务中保留推理上下文,不再把每一轮都当作全新的对话。对需要跨多个步骤、多次工具往返的智能体而言,这不是小修小补,而是把工作记忆从外挂变成了内建。
原生多智能体编排,把“协作”从框架层下放到模型层
以前做多智能体系统,常见做法是用 LangGraph、AutoGen 或自研调度器把多个模型实例组织起来。GPT-5.6 家族提供了原生多智能体编排能力,把这类协作逻辑纳入了 API 原语。这意味着子任务分派、角色切换和结果汇总可以更直接地由模型层完成,而不必在每个项目里重复造一套编排框架。对小型团队好处尤其明显:不需要维护复杂状态机,也能跑起有分工的智能体流程。
程序化工具调用,MCP 和代码之间的边界开始模糊
工具调用一直是智能体落地的关键环节。GPT-5.6 新增的程序化工具调用,让模型可以更精确地触发工具、组织参数、并处理多步工具结果。它不再只是“模型建议调用什么工具”的层面,而是把工具调用过程变得更像一段可预期、可调试的程序逻辑。结合 MCP 生态,开发者可以在更少胶水代码的情况下,把模型与真实业务系统、浏览器和内部 API 连接起来。
Sol 在 ARC-AGI-3 上的 38.3%,不是靠硬堆 token 堆出来的
基准测试的分数很容易被误读。但如果把 GPT-5.6 家族中 Sol 的表现拆开看,有一个细节比最终分数更值得关注:它是在启用保留推理和压缩的条件下拿到 38.3% 的。也就是说,分数提升和 token 消耗下降同时发生。这在以 ARC-AGI-3 这类抽象推理为标尺的测试里,并不常见。
从 13.3% 到 38.3%,分数背后的推理路径变化
ARC-AGI-3 考察的不是知识储备,而是面对陌生规则的归纳和泛化能力。Sol 从 13.3% 提升到 38.3%,意味着模型没有靠穷举或超长推理来硬解,而是通过更有效的推理路径压缩了问题空间。保留推理让模型具备了跨时间步的上下文延续能力,压缩则进一步降低了无效 token 的干扰。两者叠加,分数才呈现近三倍的跃升。
输出 token 压缩六倍,上下文窗口终于不再只是越大越好
输出 token 减少约六倍,对实际应用的意义非常大。过去许多团队为了提升推理质量,选择让模型输出冗长的思维链,结果 token 账单成倍上涨。GPT-5.6 证明了压缩后的推理状态仍然可以支撑高质量决策。这意味着开发者不必再把“长上下文”和“深推理”画等号。更紧凑的输出直接改变成本结构,也让长时间运行智能体变得现实。
Luna 追平 GPT-5.5,但成本少了 96%
BrowseComp 是一项面向浏览与信息整合能力的测试。GPT-5.6 家族中的 Luna 拿到了 84.04%,而 GPT-5.5 是 84.36%。差距只有 0.32 个百分点,几乎可以忽略。但成本从 33.27 美元降到 1.33 美元,降幅达到 96%。这个组合对于任何按任务计费的智能体产品来说,都是一个难以忽略的信号。
84.04% 对 84.36%,说明性能差可以忽略不计
在真实业务里,0.32 个百分点的差距通常不会影响购买决策。尤其是 BrowseComp 这类任务,用户更关心结果是否可靠、响应是否稳定,而不是纸面上的最后一位数。Luna 追平 GPT-5.5 意味着,开发者不必为了那一点点分数继续支付高昂的推理成本。性能进入平台期后,竞争焦点会自然转向单位经济性。
从 33.27 美元到 1.33 美元,单次浏览任务进入美分级时代
33.27 美元的成本对大量批处理任务来说几乎不可接受。几十个并发智能体跑一轮测试,账单可能就要上千美元。Luna 把单次成本压到 1.33 美元,直接让浏览类智能体从“偶尔用一下”变成“可以规模化部署”。这样的成本曲线下,很多原本被预算卡住的应用场景会重新打开,比如持续监控、批量调研和自动化信息采集。
开发者接下来的预算和架构判断,可能要推翻重来
GPT-5.6 带来的不是某条产品线的升级,而是一次成本与接口层的重新定义。当推理持久化、多智能体编排和程序化工具调用成为 API 默认能力,过去围绕 token 预算和上下文管理建立起来的工程习惯,会逐步失效。开发者需要重新算账,也需要重新设计智能体架构。
API 原语变化比模型参数更值得关注
很多团队评估新模型时,习惯先看参数规模、排行榜名次,再决定是否迁移。但 GPT-5.6 的实质变化发生在 API 原语层。推理持久化省掉的是状态管理层,原生多智能体编排省掉的是调度框架层,程序化工具调用省掉的是胶水代码层。这些节省直接反映在更短的上线周期和更低的维护成本上。模型参数反而不是最关键的变量。
上下文架构不再是越长越贵,而是该持久化就持久化
过去做智能体,开发者常常在“保留更多上下文”和“控制成本”之间二选一。GPT-5.6 的压缩能力让这个选择题变得没那么尖锐。输出 token 的大幅减少意味着,任务可以更长时间地保持推理状态,而不必频繁截断或摘要。架构上,更合理的做法是把需要跨轮次的推理交给持久化能力,把实时交互上下文交给压缩后的输出。这样系统会更轻,也更耐用。

