Artificial Analysis 评测 GPT-6 Sol 与 Luna:成本减半,智能指数持平

发布时间: 2026-09-23 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

GPT-6 Sol 和 Luna 的价格出来了,Artificial Analysis 给的数字很干脆:Sol 每百万输入 token 2 美元、输出 10 美元,Luna 是 0.1 美元和 0.5 美元,大约是 GPT-5.6 对应版本的一半。真正有意思的是另一栏——Intelligence Index 跟 GPT-5.6 打平。价格腰斩、分数不动,这两件事放在一起,比任何单点跑分都更值得琢磨。

持平的分数,比涨分更难解释

能力曲线变平了,钱却在变便宜

过去两年大家都习惯了「新一代更强」,强多少、贵多少几乎同步发生。这次反过来了。同样的分数,一半的价格,意味着你花同样的预算可以跑两倍的推理量,或者跑同样的量只掏一半钱。单位智能成本第一次成了比绝对分数更好看的那个指标。

这不代表模型没进步。更合理的解释是:通用评测能测出来的那部分能力,已经走到了收益递减的区间。再往上堆训练算力,指数上挪一两个点,用户体感几乎没有区别。但省下来的钱,是能进财报的。

Intelligence Index 测的是什么,不测什么

这套指数的做法,是把一堆异构任务压成一个可比的数字:常识问答、数学、代码、指令遵循,各自加权求总。它好用,因为能横向比价;它不够用,因为它把性质完全不同的任务当成了同一种任务。

真实工作里没有「平均任务」。写一段正则表达式,和从三十页合同里抽出五个字段,对模型的要求不是一回事。看到 Sol 与 GPT-5.6 持平,正确的读法是「通用能力同级」,而不是「拿哪个都行」。你要盯的是自己那条任务线在细分基准上的走势,尤其是编码和多步推理这两项。

Sol 和 Luna 不是快慢之分

光看名字很容易误读成「大杯和超大杯」。按价格结构推,Sol 是主力推理档,Luna 是低成本档,两者差的不是响应速度,是可承受的复杂度。Sol 撑得住长链路工具调用和多步规划;Luna 适合高频、短输出、出错代价可控的环节。一个系统里两档都用上,才是它们被设计出来的用法,而不是二选一。

把账单拆到任务粒度

输出 token 才是成本的主战场

2 和 10 中间那条斜杠,左边是输入,右边是输出。很多人看报价只看第一个数字,然后在生产环境里被第二个数字教育一遍。原因朴素得很:读进去的是一段提示词,吐出来的是完整推理痕迹加最终答案,长度常常是输入的几倍,单价还贵五倍。

Sol 的输出单价是输入的 5 倍,Luna 同样是 5 倍。两家都维持这个比例,说明它反映的是解码阶段的真实算力消耗,不是拍脑袋定的。优化方向因此非常明确——压输出,而不是压输入。结构化输出、限定字段、明确禁止模型复述问题,这些老套技巧在输出溢价高的时候,收益是成倍放的。

缓存、重试和多轮,会把差距放大

单次调用的价目表很好看,跑进 agent 里就变形。一个任务可能触发十几轮工具调用,每轮都要把上下文重新喂一遍;失败的调用要重试;没命中缓存的部分按全价结算。你的实际账单不是目录价乘以调用次数,而是目录价乘以一个系数,这个系数在真实系统里经常落在 3 到 10 之间。

所以价格减半对 agent 类产品的影响,远大于对聊天机器人的影响。聊一句省半厘钱没人关心;一个自主跑二十分钟的编码 agent 成本砍半,毛利率可能直接从负的翻成正的。

0.1 美元的 Luna 在抢谁的地盘

Luna 那个每百万输入 0.1 美元,此前基本属于小型专用模型和自托管开源模型的价位带。换句话说,OpenAI 把一款通用模型压到了「自己部署好像也没便宜多少」的位置上。做分类、抽取、意图路由这类高频低难度任务的团队,值得认真算一笔运维账:省下的不只是 API 费,还有 GPU 闲时、扩缩容的复杂度,以及凌晨三点的告警电话。

降价之后,幻觉率成了隐藏账单

便宜的错误,往往更贵

评测表里最容易被跳过的一栏是错误率和幻觉率。模型答错,和模型不答,代价完全不在一个量级。抽取任务里编出一条不存在的条款,下游得靠人工去核;客服场景里编一条退款政策,是要真金白银赔的。

这就是「同级智能、半价」这句话必须打问号的地方。指数持平是加权平均后的持平,它不保证错误的分布形状一样。完全可能 Sol 在难题上更稳、Luna 在简单题上更爱编。AI 评测页面里那些不起眼的细节数据,才决定了你到底能不能真省钱。

读那几列数字的顺序

先看自己任务对应的细分项,再看错误率与拒答率是怎么拆开的,然后才轮到价格。顺序反了,就会落到「便宜一半所以换」这种结论上,而这个结论在多数团队里都会以返工收场。

还有一点常被忽略:成本要按 token 结构估,不能按调用次数估。同样的调用次数,提示词模板改一版,账单能差出两倍。这两件事其实是一件事——既然输出是溢价的那一端,就该拿输出长度分布去反推真实单价,而不是拿次数糊弄自己。

被低估的变量:模型愿不愿意闭嘴

同一个模型,输出简洁和啰嗦,成本能差三倍。有些模型默认就喜欢长篇解释,演示时很讨喜,进了生产就烧钱。换模型的时候,得连着看它在你的提示词约束下能不能真的收住——这不是价格问题,是可控性问题,而可控性会直接写进成本。

OpenAI 这次卖的其实是确定性

从能力领先,转向成本领先

把两代产品的价格拉出这个斜率,信号已经很清楚:头部厂商开始把价格当武器,而不再只靠跑分说话。当通用能力差不太多的时候,决定客户留存的就变成了每百万 token 的单价、限流阈值和可用性。这三样东西,恰好都是采购部门能拿来对比的,而跑分不能。

迁移成本才是最后一道门槛

换模型从来不是改一行字符串。提示词要重调,工具调用的格式要重测,失败重试的策略要重新标定,评测集要重建基线。半价很香,但如果迁移要花两周工程时间,很多团队会先把这笔钱放着——不是不想省,是省的钱还不够付工程师的工时。

这也解释了为什么敢在分数持平的节点上直接砍价。它赌的是你已经在这套 API 上写了很多东西。迁移成本越高,降价就越像是一份挽留礼物,而不是一次促销。

现在该做的那点事

别急着全量切换。挑一条真实任务线,把 Sol 和 Luna 都接进去,用线上流量跑一轮,只盯四个数:正确率、幻觉率、输出 token 均值、单任务成本。四个数都赢,再谈迁移。只赢最后一个,那说明你要修的是提示词,不是模型。

价格腰斩是个好消息,但它改变不了选型的基本功。先把账算到任务粒度,再谈换不换——顺序对了,这次降价才是真的便宜。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 9

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线