Arena 更新了 Image-to-WebDev 排行榜,四个新模型直接插进座次。GPT-6 Astra(Max)以 1733 分登顶,把上一任领跑者 GPT-5.6 Sol(xHigh)甩开 129 分;Claude Fable 5.1(Max)1710 分紧随其后,Muse Spark 1.3(Max)1645 分列第四,GLM-5.3-Flash 1588 分挂在第十。这张榜测的事情很具体——扔一张图进去,看模型能不能吐出一个跑得起来的网站。
从一张图到能跑起来的前端,中间隔着什么
不是画得像,是写得对
图像理解榜单早就卷到看不清差距,认得出图里有什么、布局怎么切,头部模型基本都能答对。Image-to-WebDev 换了个考法:输入一张界面截图或设计稿,输出可以直接在浏览器里打开的 HTML、CSS 与交互脚本。这里没有"描述得准不准"的中间地带,只有"打开之后能不能用"。按钮偏了 8 像素、栅格断点没接上、表单校验漏掉一条,用户扫一眼就知道。像素级还原只是及格线,代码能不能被人接手才决定分数高低。
评分栏旁边多了一列数字
这一轮更新有个细节容易被划过去:榜单把每百万 token 的价格和分数并排放了。过去看榜只回答一个问题——谁更强。现在得同时回答两个:强多少,以及这份强值多少钱。对要把成批设计稿转成页面的团队来说,第二问往往才是拍板的那一问。分数有天花板,成本没有。
谁真的在盯着这张榜
不是研究模型能力的人。是那些正在批量交付落地页的外包团队、把设计系统搬进组件库的中台工程师、给客户做演示原型的独立开发者。他们要的不是论文级结论,是一个能用来说服同事和客户排名的排序。榜单的价值就在于它把"哪个模型干这活更靠谱"从玄学变成了可比数字。
1733 分砸下来,第一梯队的空档露出来了
129 分不是测量误差
在两两对拼、靠胜负累积的评分体系里,129 分属于断层。上一次榜首易主时,分差还在个位数上磨。Astra(Max)把领先线直接抬进了 1730 以上,GPT-5.6 Sol(xHigh)并不弱,它只是被自家继任者重新定义了坐标——同一家把标准往上提了一档,其他人就得重新找位置。
Fable 5.1 的 1710 分,差 23 分但没掉队
23 分在这场评测里分不出胜负。有信息量的是它留在了第一梯队:当榜首把分数线拉高 129 分,还能源地不动的选手,说明它的能力曲线没有被单点突破。对做选型的人来说,这个分数的实际含义是——它能进同一轮候选,和 Astra 放在一张对比表里不会显得突兀。
第四和第十,隔着五六个身位
Muse Spark 1.3(Max)1645 分排第四,GLM-5.3-Flash 1588 分排第十。两者差 57 分,中间塞了一整排模型,说明中段密度已经很高,每往前挪一名都要拿分数硬换。GLM-5.3-Flash 带着 Flash 后缀进前十是这轮里最值得琢磨的信号:轻量档位开始够得着高端模型的门槛了。
价格那一栏,才是真正的战场
每百万 token 这笔账怎么算
图像转网站有个特点:输入是一张图,输出可能是一整份前端工程。输出 token 的消耗远大于输入,一个复杂点的后台管理界面,模型要吐几千上万 token 的代码。到这一步,报价单上的每百万 token 会被放大成实打实的月度账单——分数差 5%,成本可能差出好几倍。
便宜不一定划算
低价模型的问题从来不是单次质量,是返工率。生成的页面跑不起来、样式错位、还得人工再过一遍,省下的 token 费会从工程师的工时里成倍还回去。成本要算到"可用页面"这个单位上,而不是算到 token 上。榜单把价格摆到明面上,等于逼所有人在同一个坐标系里回答这道题。
贵的那个也未必该用
反过来说,1733 分的 Astra(Max)该用在什么地方?批量生成营销落地页、把整套设计语言转成组件库,这种一次生成、多处复用的场景,头部模型的溢价摊得薄。但如果只是把一张截图变成一个静态页,第十名的模型可能已经够用。选型没有全局最优解,只有具体场景的解。
往下翻,还有几个信号值得盯
Max、xHigh 这些后缀开始带信息量了
榜上每个名字后面都挂着后缀:Astra(Max)、Sol(xHigh)、Fable 5.1(Max)。这不是装饰,它们代表推理预算或思考深度的档位。同一个模型,档位调高,分数上去,延迟和成本同步上去。只看模型名不看后缀,很容易得出错误结论——你看到的可能是这家最贵的那个配置,而它和你预算里的版本根本不是一回事。
基准榜离真实项目还有多远
Image-to-WebDev 考的只是"从图到代码"这一段。真实项目里还有需求澄清、接口对接、状态管理、上线之后的维护。榜单解决的是第一段能不能横向比较的问题,它没法告诉你某个模型在三个月后的版本迭代里会不会突然退化。基准是入场券,不是成绩单——把它当参考,别当成结论。

