启用两项 API 设置使 GPT-5.6 在 ARC-AGI-3 基准测试得分提升三倍

发布时间: 2026-07-30 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

一句大实话:眼下很多团队花数周微调模型、重写提示链,效果提升往往只有个位数百分点。但 OpenAI 最近在 GPT-5.6 上动了两项 API 设置,保留推理过程和启用压缩,直接把 ARC-AGI-3 的得分推到了原来的三倍。没有重新训练,没有改动模型权重,仅仅是改变了模型输出阶段处理自身思考结果的方式。这听上去像魔法,实际却暴露了一个被严重低估的事实——我们对于大模型推理过程中产生的大量中间信号,还远没有学会如何有效利用。

两个设置,怎么就让得分翻了三倍

保留推理:别把草稿纸扔得太早

GPT-5.6 在解决复杂推理题时,内部会产生一系列逐步推导的痕迹。默认的 API 行为是,推理完成后这些中间步骤就会被丢弃,只把最终答案返回给用户。这么做的好处是响应干净,Token 用量可控。但这也意味着大量有价值的信息——哪些路径被探索过、哪些被放弃、逻辑连接点在哪——全被浪费了。ARC-AGI-3 恰恰是一套极度依赖抽象推理和模式归纳的任务集,很多时候正确答案并不是一蹴而就的,而是潜伏在那些“被删掉的草稿纸”里。

保留推理过程本质上就是要求模型在产出最终答案时,附带暴露那条最有可能通往正确结果的思考轨迹。这不是简单的思维链(Chain-of-Thought)提示,而是从模型内部生成的多个候选推理通路中,把得分最高、逻辑最连贯的那一条保留下来,并作为上下文的一部分反馈给后续的校验步骤。这样一来,模型有机会“回头看”自己的思考,及时修正早期的符号匹配错误或类比偏差。在 ARC-AGI-3 那些需要连续几步抽象映射的任务中,这一步修正带来的累积增益极其可观。

压缩:把冗长的推理拧成高密度逻辑

保留完整推理过程虽然好,但会产生大量 Token,直接推高延迟和成本。OpenAI 给出的第二项设置——压缩——正是为了解决这个矛盾。压缩不是简单的摘要,而是对推理痕迹做语义裁剪和逻辑链精简,把啰嗦的自然语言推导转化成一个紧凑的、保留核心演绎步骤的信息块。它会把“因为 A 变成 B,再因为 B 和 C 的关系推导出 D,最后发现 D 与 E 相矛盾”这种流水账,压成“A→B, B∧C→D, ⊥(D,E)”,保留逻辑骨架而舍去解释性外壳。

这个操作之所以能进一步提升得分,是因为压缩后推理链的信息密度大幅提高,模型在下游判断时不必在大量冗余表述中重新提取关键关系,认知负载明显降低。相当于给模型配了一套速记系统——看一遍浓缩版逻辑,比反复咀嚼松散的文字叙述更不容易走偏。尤其是在多步推理题中,压缩让模型能一次性记住整个推导脉络,而不是在处理到第四步时就忘了第一步的前提。

两者协同:一个可检索的推理缓存

单独看,保留推理和压缩各有用处,但真正让 GPT-5.6 在 ARC-AGI-3 上实现三倍跃升的,是它俩的化学反应。保留机制确保推理痕迹不被丢弃,压缩将这些痕迹转化为高密度、可快速检索的逻辑缓存。当模型面对同一道题的不同变体,或者需要依赖前序推理结果进行自检时,可以直接在这个缓存上做模式匹配,而不必从头开始生成新的推理链。这就像给模型装了一个针对当前任务的临时推理记忆体,既快又准。OpenAI 自己的实验数据也印证了这一点:只开保留,提升明显但成本高;只开压缩,效率提升但精度有限;两盏灯都打开,量和质才同时跃迁。

对调用 API 的人意味着什么

从提示工程转向配置工程

过去一年,几乎所有人都在教大家怎么写更好的提示词、怎么设计多步提示链。但 GPT-5.6 这两项设置的出现,把一部分注意力从提示工程拉向了配置工程。你不用再费尽心思在 System Prompt 里塞下复杂的推理模板,因为模型自己就能以最优方式保留和压缩其推理过程。你只需要在 API 调用中开启对应的参数,然后专注于任务定义即可。对于已经在生产环境调用 GPT-5.6 做复杂分析、代码生成、科学推理的团队来说,这比任何提示技巧的回报都更直接。毕竟,改提示只能影响输入侧,而这两个开关直接改变了模型处理信息的方式。

速度、成本与精度的新平衡点

很多人第一反应是,保留推理加压缩会不会很贵?确实,保留推理步骤意味着额外的输出 Token,压缩过程也需要额外的计算。但实际测算显示,因为压缩将大量自然语言推理碎料精简为极致紧凑的逻辑表示,总输出长度常常比关闭这两项设置时还短。换言之,你用更少的 Token 换回了更高的准确率。这对按 Token 计费的商业场景是一个巨大的成本优化信号。当然,这取决于任务类型:对于简单的事实性问答,开启这两项可能反而增加延迟;但对于 ARC-AGI-3 这类硬推理任务,它几乎是一笔稳赚的买卖。

ARC-AGI-3 的分数到底值不值钱

肯定有人会说,ARC-AGI-3 只是一个基准测试,刷分不等于模型变聪明。这种警惕当然合理。但 ARC-AGI-3 相比前两代,更强调对未见过的抽象规则的快速归纳,是比较接近“流体智力”的测试。一个没有额外训练、仅通过改变推理输出方式的模型取得三倍提升,至少说明两件事:第一,模型原本的潜力被自身的默认输出策略压制了;第二,这种潜力释放方式是可复现、可推广的。如果同样的配置能在法律推理、数学证明、复杂调度等问题上复现类似增益,那么它的意义就远超一个基准测试的分数本身。

推理透明化的下一步棋

推理过程不再是一次性废料

很多大模型应用架构中,模型的中间推理过程被当作必须被隐藏或快速丢弃的废料。但 OpenAI 这次的测试结果狠狠反驳了这种惯例。保留推理,不只是为了调试或解释性,而是可以直接作为模型后续决策的输入素材。这意味着未来我们可能会看到更多的 API 设计,把推理痕迹作为一种可缓存、可检索、可组合的一等公民对待。你可以在同一会话中反复引用压缩后的推理缓存,甚至在不同用户的不同查询之间安全地复用推理片段,这会对复杂工作流产生根本性的影响。

上下文窗口被压缩技术重新定义

大模型的上下文窗口一直在变长,但长窗口并不天然等于更好的推理。把大量未经处理的原始信息塞进窗口,模型很容易在前几轮推理就被噪音淹没。压缩技术的介入,相当于在信息进入窗口之前做了一次智能蒸馏——只保留推理骨架,剔除非必要的表述脂肪。这让有限的上文窗口能承载更多轮次的逻辑链,也间接缓解了长上下文带来的注意力稀释问题。对于需要维持长时间推理一致性的场景,比如多轮谈判模拟、复杂故障树分析,压缩不仅仅是省钱,更是保住推理质量的命门。

一场静默的交互范式转移

这两项设置或许不会成为头条新闻,但它们预示着一个重要的交互范式转移:从“模型只给最终答案”,转向“模型输出一个包含自身思考痕迹的信息包”。用户不光得到结论,还能拿到一份干净的推理快照。这对于需要审核、校验、二次开发的场景是质变。你可以把这份快照投入另一个模型做独立验证,也可以存入知识库供后续比对。过去我们用提示词哄着模型一步一步想,现在模型开始学会自己保存并精炼它的思考过程了。这个变化,比任何一个单点基准测试的新高分都更值得留意。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 29

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线