Arena 更新 Image-to-WebDev 榜单:GPT-6 Astra 以 1733 分登顶

发布时间: 2026-09-16 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

Arena 更新了 Image-to-WebDev 排行榜,四个新模型直接插进座次。GPT-6 Astra(Max)以 1733 分登顶,把上一任领跑者 GPT-5.6 Sol(xHigh)甩开 129 分;Claude Fable 5.1(Max)1710 分紧随其后,Muse Spark 1.3(Max)1645 分列第四,GLM-5.3-Flash 1588 分挂在第十。这张榜测的事情很具体——扔一张图进去,看模型能不能吐出一个跑得起来的网站。

从一张图到能跑起来的前端,中间隔着什么

不是画得像,是写得对

图像理解榜单早就卷到看不清差距,认得出图里有什么、布局怎么切,头部模型基本都能答对。Image-to-WebDev 换了个考法:输入一张界面截图或设计稿,输出可以直接在浏览器里打开的 HTML、CSS 与交互脚本。这里没有"描述得准不准"的中间地带,只有"打开之后能不能用"。按钮偏了 8 像素、栅格断点没接上、表单校验漏掉一条,用户扫一眼就知道。像素级还原只是及格线,代码能不能被人接手才决定分数高低。

评分栏旁边多了一列数字

这一轮更新有个细节容易被划过去:榜单把每百万 token 的价格和分数并排放了。过去看榜只回答一个问题——谁更强。现在得同时回答两个:强多少,以及这份强值多少钱。对要把成批设计稿转成页面的团队来说,第二问往往才是拍板的那一问。分数有天花板,成本没有。

谁真的在盯着这张榜

不是研究模型能力的人。是那些正在批量交付落地页的外包团队、把设计系统搬进组件库的中台工程师、给客户做演示原型的独立开发者。他们要的不是论文级结论,是一个能用来说服同事和客户排名的排序。榜单的价值就在于它把"哪个模型干这活更靠谱"从玄学变成了可比数字。

1733 分砸下来,第一梯队的空档露出来了

129 分不是测量误差

在两两对拼、靠胜负累积的评分体系里,129 分属于断层。上一次榜首易主时,分差还在个位数上磨。Astra(Max)把领先线直接抬进了 1730 以上,GPT-5.6 Sol(xHigh)并不弱,它只是被自家继任者重新定义了坐标——同一家把标准往上提了一档,其他人就得重新找位置。

Fable 5.1 的 1710 分,差 23 分但没掉队

23 分在这场评测里分不出胜负。有信息量的是它留在了第一梯队:当榜首把分数线拉高 129 分,还能源地不动的选手,说明它的能力曲线没有被单点突破。对做选型的人来说,这个分数的实际含义是——它能进同一轮候选,和 Astra 放在一张对比表里不会显得突兀。

第四和第十,隔着五六个身位

Muse Spark 1.3(Max)1645 分排第四,GLM-5.3-Flash 1588 分排第十。两者差 57 分,中间塞了一整排模型,说明中段密度已经很高,每往前挪一名都要拿分数硬换。GLM-5.3-Flash 带着 Flash 后缀进前十是这轮里最值得琢磨的信号:轻量档位开始够得着高端模型的门槛了。

价格那一栏,才是真正的战场

每百万 token 这笔账怎么算

图像转网站有个特点:输入是一张图,输出可能是一整份前端工程。输出 token 的消耗远大于输入,一个复杂点的后台管理界面,模型要吐几千上万 token 的代码。到这一步,报价单上的每百万 token 会被放大成实打实的月度账单——分数差 5%,成本可能差出好几倍。

便宜不一定划算

低价模型的问题从来不是单次质量,是返工率。生成的页面跑不起来、样式错位、还得人工再过一遍,省下的 token 费会从工程师的工时里成倍还回去。成本要算到"可用页面"这个单位上,而不是算到 token 上。榜单把价格摆到明面上,等于逼所有人在同一个坐标系里回答这道题。

贵的那个也未必该用

反过来说,1733 分的 Astra(Max)该用在什么地方?批量生成营销落地页、把整套设计语言转成组件库,这种一次生成、多处复用的场景,头部模型的溢价摊得薄。但如果只是把一张截图变成一个静态页,第十名的模型可能已经够用。选型没有全局最优解,只有具体场景的解。

往下翻,还有几个信号值得盯

Max、xHigh 这些后缀开始带信息量了

榜上每个名字后面都挂着后缀:Astra(Max)、Sol(xHigh)、Fable 5.1(Max)。这不是装饰,它们代表推理预算或思考深度的档位。同一个模型,档位调高,分数上去,延迟和成本同步上去。只看模型名不看后缀,很容易得出错误结论——你看到的可能是这家最贵的那个配置,而它和你预算里的版本根本不是一回事。

基准榜离真实项目还有多远

Image-to-WebDev 考的只是"从图到代码"这一段。真实项目里还有需求澄清、接口对接、状态管理、上线之后的维护。榜单解决的是第一段能不能横向比较的问题,它没法告诉你某个模型在三个月后的版本迭代里会不会突然退化。基准是入场券,不是成绩单——把它当参考,别当成结论。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 41

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线