Artificial Analysis 把 Qwen-Image-2.1 拉进自己的评测环境跑了一遍——不是看厂商递上来的样图,是本地部署。这个 9 月 20 日以开源权重放出的模型,在 AA-Image-T2I v2.0 与 AA-Image-Editing v2.0 两张榜上同时排到第 18,两张榜上都是开源权重阵营里名次最高的那一个,把 Ideogram 4.0(Quality)和 HunyuanImage 3.0 Instruct 都压在了后面。质量评分 69/100。数字不大,位置不低。
第 18 名,含金量不在名次本身
榜单不按开源闭源分组
Artificial Analysis 的图文排名是一张混合表。闭源模型的 API、开源模型的权重,全扔进同一套题目里比,同一个打分口径出分。所以第 18 名不是"开源组冠军"这种安慰性质的标签,而是在和所有商业模型硬碰硬之后落到序列中上游的位置。一个权重能下载、能自部署、能改完再商用的模型站到这里,两年前几乎没人会当成常态。那时候的开源图像模型,多数连榜单前半段都摸不着。
编辑这条路,比文生图难糊弄
文生图考的是想象力和美学判断,编辑考的是理解力和服从度。指令说"把左边那盏灯换成暖光,背景别动",模型得先分清哪个是灯、哪个是背景,再决定哪些像素该动、哪些必须原样保留。局部改动最容易露馅:边缘糊成一团,主体悄悄漂移,没让它改的地方被顺手重绘一遍。在 AA-Image-Editing v2.0 上拿下开源阵营最高位次,说明它在指令跟随这一项上不是靠堆采样步数糊过去的,而是真的在理解"改哪里"和"不改哪里"。
被越过的两个名字
Ideogram 4.0 的 Quality 档一直以文字渲染和版式控制见长,HunyuanImage 3.0 Instruct 背后是腾讯在多模态上的长期投入。这两个都不是软柿子。把它们甩在身后,含义比名次本身更具体:开源权重在图像侧已经不靠"能出图"参与竞争,开始在某些细分能力上争夺话语权。开发者选型清单里的默认项,正在被这种变化一点点改写。
阿里走的是先给权重、再谈别的
9 月 20 日这个时间点
开源权重的发布节奏本身就是策略的一部分。模型训完的那天,很少正好是适合放权重的那天。得挑一个既能吃到社区关注、又不至于让云端商业版失血的位置。Qwen-Image-2.1 选在 9 月下旬放出,紧接着第三方评测机构就完成了本地部署和跑分——从发布到上榜之间的空窗短到可以忽略。这种紧凑说明厂商对混合榜上的表现心里有数,否则没必要把节奏压这么紧。
图像赛道上,中国团队的集体动作
过去一年多,文本模型的开源竞争打得火星四溅,图像这条线相对安静。Qwen-Image 系列、HunyuanImage,还有一批从视频生成切过来的团队,正把这块空白迅速填上。打法和以前不同:先拿权重换下载量、换微调分支、换社区惯性,再用生态反哺云上的托管与商业授权。跟当年拼参数规模、拼单榜名次的路数不是一回事,落点在长期占用率,不在发布当天的声量。
权重放出去之后,长出来的是别的东西
模型能以权重形式流通,价值就不止于推理本身。LoRA、ControlNet、量化版本、针对特定画风或行业的微调分支,通常几周内就会从社区里冒出来。这些活儿厂商自己做不完,也不该自己做。两张榜上的位置只是起点,真正的杠杆握在使用者手里——他们决定这个模型最后被用在电商主图、游戏原画,还是工业设计的概念稿上。
69 分,够用,还是不够用
前面那 17 个位置还没松动
69/100 是 Artificial Analysis 给出的综合质量分。第 18 名意味着前面还排着 17 个。头部闭源模型在极端提示词、复杂构图、密集文字渲染这些高压测试项上仍然占优,差距没有被抹平。开源阵营追上来的方式是"够用且便宜",不是"全面更强"。这两句话的价值完全不同,混在一起谈,很容易得出一个漂亮但错误的结论。
榜单分数和生产可用性之间,隔着一段路
评测用的是标准化题目、统一打分口径、干净的输入。真实业务里,提示词是脏的,参考图是糊的,需求方会在出图之后补一句"再往左一点"——而这句话没有标准答案。69 分能不能撑起一条日产几千张主图的流水线,取决于延迟、并发、显存占用和失败重试的综合成本。这些指标不上榜,却决定了模型能不能从演示走到生产。
真正买单的人在看什么
团队选图像模型,第一眼看效果,第二眼看价格,第三眼看能不能改。开源权重在第三项上没有上限。当排名进入中上游,前两项不再是明显短板,可改性就成了决定性的那一条。自己部署一套推理、按自己的数据微调、把中间层接进现有工作流——这些在闭源 API 上要么做不到,要么代价高到不划算。
接下来这段时间,盯三件事
闭源顶部会不会重新拉开距离
商业模型手里还攥着数据、算力和工程调优三张牌。下一代闭源版本若能把分差重新拉开,开源的追赶节奏就要重算;分差继续收窄的话,闭源模型的价值主张就得往工作流集成、API 稳定性、企业合规这些方向挪。判断这个方向,比记住某一次榜单名次重要得多。
微调社区把它推到哪一步
基座排名不等于最终形态。社区会拆开它、换组件、喂进专有数据,几个月后可能出现一批在特定任务上明显强过原版的衍生模型,而它们在通用榜上根本不会现身。判断一个开源权重模型是否成功,这个指标比发布当天的名次更有说服力。
评测口径自己也会变
AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 都挂着版本号,说明评测方法本身在迭代。题目会换,权重会调,名次会重排。今天第 18,下个月可能第 12,也可能第 25,都不奇怪。真正稳定的信息是趋势:开源权重的图像模型已经进入和商业模型同场竞争的阶段,不再只是陪跑的角色。

