46 分。Grok 4.7 在 Artificial Analysis Intelligence Index 上拿到这个分数,比 Grok 4.6 高出 2 分。就这两分,把 SpaceXAI 送进了全球前四大 AI 实验室的名单。版本号只跳了一位小数,排位却换了一档——这种事在前沿模型竞赛里并不常见,值得掰开看。
两分,究竟买到了什么
指数不是一把等距的尺子
Artificial Analysis 的 Intelligence Index 是合成指标,把推理、数学、代码、科学问答等多项基准揉成一个数字,再折算成便于横向比较的刻度。这种做法的好处是一眼能看个大概,坏处是——分数越往上走,每一分的含金量越不均匀。
从 30 分爬到 40 分,靠的是把基础能力补齐;从 44 分爬到 46 分,靠的往往是某个具体的短板被硬啃下来。评测方这次单独拎出编码智能体的得分来说事,本身就是线索:那两分不是全面微调磨出来的,而是有明确的着力点。
小数点迭代,背后是一次定向手术
把一个版本从 4.6 推到 4.7,工程上可能对应好几种动作。可能是后训练阶段的数据配比调整,可能是推理时计算的预算放宽,也可能只是把工具调用链路修顺了。外人看不到训练日志,但可以从评测的结构里反推。
编码智能体这一项同时考多轮交互、文件操作、工具选择、失败重试。这块分数抬起来,说明改动落点在“让模型在真实工作流里别掉链子”,而不是让它多背几条定理。
前四这张桌子,位置是抢来的
四大实验室的排序从来不是固定座位。有人上桌,就有人被挤到边上。GroK 4.7 的 46 分带来的直接后果,是 SpaceXAI 在综合榜单上有了和头部门槛对话的资格。
资格这东西听着虚,落到生意上很实:云厂商的接入谈判、企业采购的短名单、开发者在选型文档里愿不愿意多写一行。榜单排位不决定胜负,但它影响谁先被想起来。
编码智能体,评测里最贵的那一格
为什么基准测试开始盯住 Agent
单轮代码补全的评测早就打不出区分度了。给一个函数签名,让模型填空,前沿模型基本都能做对,分数挤在顶部那条窄带里,谁高谁低全看运气。真正的价值区间,转移到了多轮、带工具、带文件系统、带环境状态的智能体任务上。
这类评测设计起来难受得多。任务要足够长,长到模型必须管理上下文;环境要足够真,真到一次错误调用就会让状态崩掉。也正因为难测,能测出差距的地方才有信息量。Artificial Analysis 把编码智能体的成绩单独列出来,是在告诉读者:综合指数之外,这里还有一份更贴近付费意愿的成绩单。
代价比才是采购桌上那张纸
评测方这次给出的不只是一串分数,还有得分与代价的比值。这一点比排名更有用。
同样完成一项编码任务,不同模型的 token 消耗、推理时长和账单差距可以拉到几倍。一个模型单次表现更好,但如果每次都要跑满推理预算、调用几十轮工具,单位任务成本反而可能压过性能稍弱但更克制的对手。工程团队在预算表上看到的从来不是“智能指数 46”,而是“这个月 API 账单多少”。
所以看这类评测,别只盯着最上面那行数字。往下翻,找到成本那一列,再把自己的任务量代进去算一遍,结论经常会反过来。
高分模型在长任务里未必稳
基准测试是抽样的,工程现场是全量的。一个模型在评测集上把 90% 的任务做对,听起来漂亮;但真实项目里,剩下那 10% 常常集中在长上下文漂移、工具调用参数拼错、失败后不知道回头这几个地方。它们不会均匀分布,而是扎堆出现在流程最复杂的那几步。
判断一个编码智能体能不能上生产,基准分数只是入场券。真正该问的是:跑到第四十轮的时候,它还记不记得最初的目标?出错之后,它会不会重复同一个错误?
SpaceXAI 这个名字,本身就是一条新闻
组织形态就是产品路线的外泄
实验室名称的变化从来不只是品牌动作。名字背后是资源怎么整合、算力从哪里来、数据管道归谁管。把航天、通信、模型训练放在同一个体系里叙述,讲的是基础设施与模型的耦合故事。
这条路走通的逻辑很直接:自有算力摊薄训练成本,自有场景提供真实任务数据,自有渠道把模型直接推到终端用户面前。难点同样直接——组织复杂度会指数上升,模型迭代的节奏容易被非技术议程打断。
第三还是第四,取决于你问谁
有意思的细节在这里。Artificial Analysis 的综合指数把 SpaceXAI 排进前四;而在公开表态里,马斯克的说法是 Grok 4.7 让它在智能体编码领域位列第三。
两个数字不矛盾,只是口径不同。一个是跨维度的加权合成,一个是单领域的专项排名。企业选型时会遇到同样的困惑:市面上的榜单各说各话,因为大家测的东西本来就不是一回事。判断哪张榜有用,第一步是看它的权重表,而不是看它的名次表。
真正要选模型的人,该怎么用这份评测
把榜单折成自己的任务清单
榜单的第一个用途是筛掉明显不合适的选项,不是选出第一名。看到 Grok 4.7 的编码智能体分数和代价比之后,正确的动作是回去翻自己的工单库:挑三十到五十条真实任务,跑一遍对照测试。
任务要覆盖你最常做的那几类——重构、修 bug、写测试、读陌生代码库。跑完之后打分维度也别照搬评测机构的,按你自己的口径来:一次通过率、返工次数、人工介入时间、账单金额。这套数据比任何第三方排名都硬。
成本曲线会随规模翻转
小规模试用时的最优解,放大十倍之后经常不再是。单任务更贵但一次做对的模型,在低并发场景下省人工;一旦任务量上来,多轮重试的累积开销会迅速吃掉那点优势。
反过来,便宜模型多跑几轮、用验证环节兜底的策略,在批处理场景里可能更划算。这不是模型能力的比较,是数学题。选型讨论里最容易缺的,恰恰是这道算术。
别把评测当成长期承诺
基准分数是某个时间点的快照。模型会更新,推理后端会换硬件,价格表会调整,某些能力还可能在版本迭代中悄悄回退。今天排第四的模型,三个月后可能因为一次量化优化掉出短名单。
所以架构上要留后路。把模型调用封在薄薄一层抽象之后,让切换成本保持在几天工作量以内;把评测脚本沉淀成常跑的回归测试,每次版本更新都过一遍。这样榜单怎么变,你都不慌。
46 分是个不错的成绩,2 分的进步也值得记一笔。但榜单的作用从来是提出问题,答案得自己跑出来。

