Artificial Analysis 评测 GPT-6 Sol 和 Luna:成本减半但各评测有升有降

发布时间: 2026-09-23 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

GPT-6 Sol 和 Luna 的价格一出来,圈内第一反应是"又降价了"。Artificial Analysis 给出的账单很直白:Sol 每百万输入/输出 token 卖 2 美元和 10 美元,Luna 只卖 0.1 美元和 0.5 美元,两个型号都把 GPT-5.6 同名版本的价格压到了大约一半。但真正值得琢磨的不是省下的那点钱。当同等量级的智能指数被打成半价,一批过去算不过账的活儿会突然变得划算——自动化的边界从来不是由模型能力单独决定的,它也由每条 token 的价格决定。

价格砍半,被改写的是"什么活值得交给模型"

便宜的一半,未必落在账单上

token 单价只是账单的分子。完整账单是单价乘以推理长度、重试次数、agent 循环的步数之和。便宜模型有个隐性副作用:你会更舍得让它多试几次、多读几个文件、多跑一轮自我检查。这些行为叠加起来,成本可能不降反升,省下的单价被挥霍掉的步数吃掉。反过来,在调用量大、单次任务短、失败代价低的场景里,单价下降几乎是一比一传导到账单。所以判断该不该换,先别问"便宜多少",要问"我的调用里,有多少是短平快的"。

Sol 和 Luna 差了 20 倍,这不是同一个梯队的两个尺寸

按输入价算,Luna 比 Sol 便宜整整 20 倍,输出端同样是 20 倍。这么大的价差说明 OpenAI 没把它们当成"大杯和超大杯"来卖,而是做了明确分工:Sol 站在需要判断力、需要一次做对的位置,Luna 被推到那些量大、琐碎、错了重来也不心疼的位置。用错梯队的代价往往比用贵模型更高。让 Luna 去啃复杂重构,反复失败的重试会把省下的钱连本带利吐回去;让 Sol 去干格式化抽取这类机械活,则是纯粹的浪费。

省下来的预算,通常不会留在原地

历史上每一次推理降价,最后都不是让账单变小,而是让用法变贪。单价掉一半,团队的第一反应往往是把上下文从 32K 拉到 128K,把候选方案从 3 个加到 10 个,把一次调用拆成"生成—自检—重写"三段。这是好事:过去被成本压住的产品设计空间被释放出来了。但它也意味着,做预算时不能只拿旧用量乘以新单价,得按"你会怎么改变用法"来算。

基准表上的升降,比总分更有信息量

智能指数持平,意味着什么

Artificial Analysis 的结论里最醒目的四个字是"指数持平"——新模型没有靠牺牲综合能力来换低价。这在价格战里并不常见。降价的路子通常两条:一条是蒸馏,把大模型的能力压进小模型,代价是复杂推理上的衰减;另一条是工程优化,同样的能力用更少的算力跑出来,能力基本不动。从指数持平这个结果看,这一轮更接近后者。但"持平"是个平均值,而平均值会掩盖结构性变化,只看一个总分就下结论,容易踩空。

幻觉率是那条暗线

降价之后模型会不会更容易胡说,是所有人心里没说出口的问题。把幻觉相关的评测单列出来看很有必要,理由很简单:幻觉对成本的杀伤是隐性的。一个爱编造的模型表面上 token 更便宜,但它会把你拖进"发现错误—重新提问—再验证"的循环,人工复核的时间成本远高于那点差价。客服、法务、医疗这类场景里,幻觉率哪怕小幅上升,也足以抵消全部降价收益。评估新模型时,这一栏的权重应该高于综合分。

逐项看升降,能看到取舍的痕迹

任何一次"综合能力不变"的发布,拆到科目级别都会看到有升有降。那是工程取舍留下的指纹:某些推理链条被压缩了,某些知识覆盖被重新分配了。读懂这些升降,比记住总排名有用得多,因为你的业务只落在其中几个科目上。做代码补全的盯编码类,做长文档问答的盯长上下文与检索类,做多轮工具调用的盯 agent 类。总分一样,落到你的场景里可能是完全不同的两个模型。

编码,是第一个被重新定价的战场

Codex 和 ChatGPT Work 里的分工

Sol 和 Luna 已经推进 Codex 与 ChatGPT Work,这个顺序不是偶然。编码是目前 token 消耗最密集、收益又最容易量化的场景:一次任务要读文件、改代码、跑测试、修报错,循环几十步是常态。在这种结构里,单价乘以步数的效应被放到最大。一个合理的分法正在成型——让贵的模型做规划、拆解和关键改动,让便宜的模型做批量生成、样板代码、日志分析和测试补齐。

agent 循环里,每一步都在计费

把 agent 想成一列火车,每节车厢单独收费。过去为了让整列车跑得稳,只能全程用贵模型;现在可以在中间挂几节便宜车厢——读取文件、解析报错、生成候选补丁交给 Luna,真正需要判断力的那几步再切回 Sol。这种混合编组的做法,在两代模型价差 20 倍的时候才有意义。它也解释了为什么一张价格表的变动会直接改变 agent 产品的架构选择,而不只是运维成本表上的一个数字。

便宜的那个,兜不住复杂重构

但别指望 Luna 什么都能接。长上下文里的信息保持、跨文件的依赖推理、需要理解业务意图的重构,这些任务对模型的要求是台阶式的,不是渐进的。便宜模型在这些地方的表现往往不是"差一点",而是"错得让你更难查"。判断方法很土但有效:把同一批真实工单同时丢给两个模型,不看通过率,看人工返工的时间。返工时间一旦超过 token 差价,便宜就是假的。

换还是不换,是道算术题

个人开发者:先动调用量最大的那条链路

别整体迁移,先翻日志,找 token 消耗排前三的接口。它们通常干着最机械的活,换成 Luna 的风险最低、收益最直接。跑一周,盯失败率和重试次数有没有抬头。这套流程花不了半天,却能省掉后面几周的排查。

团队:用真实流量做 A/B,别拿公开榜拍板

公开基准是用来筛候选的,不是用来做决策的。把 5% 的线上流量切给新模型,观察三件事:任务成功率、平均返工时间、单任务总成本。三件事里有两件变好,才值得扩大比例。做这个对比时有一条铁律——评估集必须来自你自己的业务,否则你测的是别人的场景。

什么时候该按兵不动

如果业务对错误极度敏感,或者当前调用量本来就不大,这轮降价的绝对收益有限,迁移带来的不确定性反而不划算。还有一种情况值得等:如果你的场景高度依赖长上下文和复杂推理,而这两个方向恰好可能是新模型做了取舍的地方,那就先观望一两周,等行业里跑出更多真实反馈再说。

这轮降价,争的是单位智能的价格

降价不是促销,是产能问题

把价格砍半通常只有两种解释:推理效率真的提升了,或者用低价换市场份额。同时推出高价位的 Sol 和极低价的 Luna,更像是前者叠加分层定价——用一个型号守住能力上限,用另一个型号去试探智能的底价在哪里。对使用者来说,这个策略的副产品是:那些卡在"必须用最好的"和"不值得用模型"之间的任务,第一次有了明确的价格坐标。

接下来值得盯的几个信号

看三件事就够了。第一,Luna 的实际采用率——如果它在 agent 和批处理场景里铺开,说明低价位确实有真实需求。第二,Sol 的价格会不会跟着松动——如果连高端型号都开始降,说明竞争压力已经传导到利润最厚的地方。第三,幻觉率在后续版本里的走向——价格可以一直降,可信度一旦掉下去,是很难用价格赎回来的。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 94

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线