一句大实话:眼下很多团队花数周微调模型、重写提示链,效果提升往往只有个位数百分点。但 OpenAI 最近在 GPT-5.6 上动了两项 API 设置,保留推理过程和启用压缩,直接把 ARC-AGI-3 的得分推到了原来的三倍。没有重新训练,没有改动模型权重,仅仅是改变了模型输出阶段处理自身思考结果的方式。这听上去像魔法,实际却暴露了一个被严重低估的事实——我们对于大模型推理过程中产生的大量中间信号,还远没有学会如何有效利用。
两个设置,怎么就让得分翻了三倍
保留推理:别把草稿纸扔得太早
GPT-5.6 在解决复杂推理题时,内部会产生一系列逐步推导的痕迹。默认的 API 行为是,推理完成后这些中间步骤就会被丢弃,只把最终答案返回给用户。这么做的好处是响应干净,Token 用量可控。但这也意味着大量有价值的信息——哪些路径被探索过、哪些被放弃、逻辑连接点在哪——全被浪费了。ARC-AGI-3 恰恰是一套极度依赖抽象推理和模式归纳的任务集,很多时候正确答案并不是一蹴而就的,而是潜伏在那些“被删掉的草稿纸”里。
保留推理过程本质上就是要求模型在产出最终答案时,附带暴露那条最有可能通往正确结果的思考轨迹。这不是简单的思维链(Chain-of-Thought)提示,而是从模型内部生成的多个候选推理通路中,把得分最高、逻辑最连贯的那一条保留下来,并作为上下文的一部分反馈给后续的校验步骤。这样一来,模型有机会“回头看”自己的思考,及时修正早期的符号匹配错误或类比偏差。在 ARC-AGI-3 那些需要连续几步抽象映射的任务中,这一步修正带来的累积增益极其可观。
压缩:把冗长的推理拧成高密度逻辑
保留完整推理过程虽然好,但会产生大量 Token,直接推高延迟和成本。OpenAI 给出的第二项设置——压缩——正是为了解决这个矛盾。压缩不是简单的摘要,而是对推理痕迹做语义裁剪和逻辑链精简,把啰嗦的自然语言推导转化成一个紧凑的、保留核心演绎步骤的信息块。它会把“因为 A 变成 B,再因为 B 和 C 的关系推导出 D,最后发现 D 与 E 相矛盾”这种流水账,压成“A→B, B∧C→D, ⊥(D,E)”,保留逻辑骨架而舍去解释性外壳。
这个操作之所以能进一步提升得分,是因为压缩后推理链的信息密度大幅提高,模型在下游判断时不必在大量冗余表述中重新提取关键关系,认知负载明显降低。相当于给模型配了一套速记系统——看一遍浓缩版逻辑,比反复咀嚼松散的文字叙述更不容易走偏。尤其是在多步推理题中,压缩让模型能一次性记住整个推导脉络,而不是在处理到第四步时就忘了第一步的前提。
两者协同:一个可检索的推理缓存
单独看,保留推理和压缩各有用处,但真正让 GPT-5.6 在 ARC-AGI-3 上实现三倍跃升的,是它俩的化学反应。保留机制确保推理痕迹不被丢弃,压缩将这些痕迹转化为高密度、可快速检索的逻辑缓存。当模型面对同一道题的不同变体,或者需要依赖前序推理结果进行自检时,可以直接在这个缓存上做模式匹配,而不必从头开始生成新的推理链。这就像给模型装了一个针对当前任务的临时推理记忆体,既快又准。OpenAI 自己的实验数据也印证了这一点:只开保留,提升明显但成本高;只开压缩,效率提升但精度有限;两盏灯都打开,量和质才同时跃迁。
对调用 API 的人意味着什么
从提示工程转向配置工程
过去一年,几乎所有人都在教大家怎么写更好的提示词、怎么设计多步提示链。但 GPT-5.6 这两项设置的出现,把一部分注意力从提示工程拉向了配置工程。你不用再费尽心思在 System Prompt 里塞下复杂的推理模板,因为模型自己就能以最优方式保留和压缩其推理过程。你只需要在 API 调用中开启对应的参数,然后专注于任务定义即可。对于已经在生产环境调用 GPT-5.6 做复杂分析、代码生成、科学推理的团队来说,这比任何提示技巧的回报都更直接。毕竟,改提示只能影响输入侧,而这两个开关直接改变了模型处理信息的方式。
速度、成本与精度的新平衡点
很多人第一反应是,保留推理加压缩会不会很贵?确实,保留推理步骤意味着额外的输出 Token,压缩过程也需要额外的计算。但实际测算显示,因为压缩将大量自然语言推理碎料精简为极致紧凑的逻辑表示,总输出长度常常比关闭这两项设置时还短。换言之,你用更少的 Token 换回了更高的准确率。这对按 Token 计费的商业场景是一个巨大的成本优化信号。当然,这取决于任务类型:对于简单的事实性问答,开启这两项可能反而增加延迟;但对于 ARC-AGI-3 这类硬推理任务,它几乎是一笔稳赚的买卖。
ARC-AGI-3 的分数到底值不值钱
肯定有人会说,ARC-AGI-3 只是一个基准测试,刷分不等于模型变聪明。这种警惕当然合理。但 ARC-AGI-3 相比前两代,更强调对未见过的抽象规则的快速归纳,是比较接近“流体智力”的测试。一个没有额外训练、仅通过改变推理输出方式的模型取得三倍提升,至少说明两件事:第一,模型原本的潜力被自身的默认输出策略压制了;第二,这种潜力释放方式是可复现、可推广的。如果同样的配置能在法律推理、数学证明、复杂调度等问题上复现类似增益,那么它的意义就远超一个基准测试的分数本身。
推理透明化的下一步棋
推理过程不再是一次性废料
很多大模型应用架构中,模型的中间推理过程被当作必须被隐藏或快速丢弃的废料。但 OpenAI 这次的测试结果狠狠反驳了这种惯例。保留推理,不只是为了调试或解释性,而是可以直接作为模型后续决策的输入素材。这意味着未来我们可能会看到更多的 API 设计,把推理痕迹作为一种可缓存、可检索、可组合的一等公民对待。你可以在同一会话中反复引用压缩后的推理缓存,甚至在不同用户的不同查询之间安全地复用推理片段,这会对复杂工作流产生根本性的影响。
上下文窗口被压缩技术重新定义
大模型的上下文窗口一直在变长,但长窗口并不天然等于更好的推理。把大量未经处理的原始信息塞进窗口,模型很容易在前几轮推理就被噪音淹没。压缩技术的介入,相当于在信息进入窗口之前做了一次智能蒸馏——只保留推理骨架,剔除非必要的表述脂肪。这让有限的上文窗口能承载更多轮次的逻辑链,也间接缓解了长上下文带来的注意力稀释问题。对于需要维持长时间推理一致性的场景,比如多轮谈判模拟、复杂故障树分析,压缩不仅仅是省钱,更是保住推理质量的命门。
一场静默的交互范式转移
这两项设置或许不会成为头条新闻,但它们预示着一个重要的交互范式转移:从“模型只给最终答案”,转向“模型输出一个包含自身思考痕迹的信息包”。用户不光得到结论,还能拿到一份干净的推理快照。这对于需要审核、校验、二次开发的场景是质变。你可以把这份快照投入另一个模型做独立验证,也可以存入知识库供后续比对。过去我们用提示词哄着模型一步一步想,现在模型开始学会自己保存并精炼它的思考过程了。这个变化,比任何一个单点基准测试的新高分都更值得留意。

