Claude Fable 5.1 在 Artificial Analysis 的智能指数上登顶了,66分。看上去不过是又一个“最强模型”的头衔更迭,但如果只看到分数,你就错过了一场关于“智能该付多少钱”的定价实验。这次评测的特殊之处在于:它没有给一个笼统的基准分,而是把 effort 档位拆开,让性能和成本赤裸裸地摆在你面前。
一、登顶背后,评测逻辑变了
分数是怎么算出来的?
Artificial Analysis 的 Intelligence Index 不是一个单点测试,而是把多种推理基准综合成一个可比较的指数。Claude Fable 5.1 在最高强度的 max effort 设置下拿到 66 分,超过此前所有模型。这个结果有参考价值,但前提是你理解它的边界:它测的是“模型在榨干计算资源时能给出的最好答案”,不是日常轻量使用时的表现。
多档 effort,比分数更诚实
这次评测最有信息量的部分,是它公布了不同 effort 档位的得分。除了 max effort 的 66 分,还有更低强度下的表现。这让用户第一次能像挑菜一样,按自己的代价预算去选“几分熟”的模型。对比起来,过去的基准测试大多只报巅峰成绩,仿佛所有人都该把模型开到满负荷——这显然不符合真实世界的使用习惯。
预发布评测的微妙位置
Artificial Analysis 参与了预发布评估,这意味着它能提前拿到模型并进行深度测试。好处是报告发布时数据完整,坏处是评测方和模型方之间是否存在隐性互动,外人不得而知。我不认为这是阴谋论,但“评测机构参与预发布”这件事本身,就值得让你的信任打个折扣。看任何登上王座的分数,都要留一分清醒。
二、智能与成本,一场明码标价的博弈
max effort 的代价不低
在 Artificial Analysis 的报告中,每任务成本与 effort 档位直接挂钩。max effort 的得分最高,但消耗的计算资源也最夸张。对于跑一个简单 QA 或常规代码补全的任务,用满打满算的 max effort,就像开法拉利去菜市场——不是不能开,是没必要。
每任务成本对比:值不值?
评测同期把 Claude Fable 5.1 在不同档位的每任务成本列了出来。低 effort 档位得分会下降,但成本可能只有 max effort 的几分之一。你真正要问的不是“哪个模型最强”,而是“我的业务场景,值得花几倍价格去买那多出来的几分智能吗?” 很多时候答案是否定的。
按场景选档位,而不是无脑拉满
如果你在处理复杂推理、长链规划、或者高难度代码问题,max effort 的溢价完全可以接受。但如果是客服摘要、邮件分类、信息抽取,用中低档 effort 可能更划算。Artificial Analysis 的数据恰好给了你一个做成本决策的参考系:先看分差,再算差价。聪明的工程团队,会把不同档位混用,而不是所有请求都走一条路。
三、登顶之后,场上格局在暗涌
评测风向正在跟着模型变
过去评测机构总爱追一套固定基准,模型们像参加考试的学生。现在 Artificial Analysis 把 effort 和成本纳入指数,本质上是在提醒市场:智能不是一个点,是一条带。评测维度一变,模型间的排位就有了语境。今天一个 66 分登顶,明天另一个模型可能在同等成本下跑出相近分数,这顶王冠戴不稳。
命名和分层的商业逻辑
Claude Fable 5.1 与 Claude Mythos 5.1 的命名,一眼就能看出 Anthropic 在做产品分层:一个主打极致智能,另一个可能偏向响应速度或性价比。这次评测中 Fable 5.1 的亮眼表现,很可能是在为高端产品线造势,让那些需要“智能天花板”的企业客户有个明确选择。模型不再是单点发布,而是一套光谱。
推理成本才是下半场的胜负手
当各家都能靠 scaling 冲上 65 分的时候,决定谁能跑进真实业务场景的,就是推理成本。Claude Fable 5.1 的登顶给了 Anthropic 一个漂亮的数据点,但并不意味着它能在所有预算区间通吃。OpenRouter 上已经能看到 Fable 5.1 的上线,可实测成本和速度,才是社区用脚投票的依据。评测指数只是起跑线,效率曲线才是赛道。

