3 分。通义千问 Qwen-Image-2.1 在 Arena 图像编辑竞技场拿下 1367 分,开源第一,总榜第 16,距第 15 名的 GPT-Image-1.5-high-fidelity 只差 3 分。这个数字放在两年前几乎不可想象——一个开放权重的模型,和闭源头部的差距用个位数分来衡量。更值得琢磨的是,它同时登上了 Text-to-Image Arena 的开源第一。两线作战,两条都赢,这就不是运气了。
1367 分背后,排名只是副产品
Arena 的分数不是考试分
Arena 的评分机制基于人类盲测投票,用户在实际使用中比较两个模型的输出,选出更好的那个。这意味着分数反映的是"真实偏好",而不是实验室指标。1367 分是什么概念?在这个榜单上,一分之差往往意味着数百次人类投票的累积偏移。所以 3 分的差距——说小也小,说大也大。它说明 Qwen-Image-2.1 在多数场景下已经能和顶级闭源模型打得有来有回,但在某些细分能力上还有微妙的差距。
开源第一不是安慰奖
有人会说,开源第一有什么好炫耀的,总榜第 16 嘛。这个看法其实过时了。过去一年,开放权重模型在图像领域的爬升速度远超文本领域。文本模型的开源追赶用了差不多两年才摸到闭源第一梯队的边,图像领域把这个时间压缩到了不到一年。Qwen-Image-2.1 拿下图像编辑榜开源第一,同时占据文生图榜开源第一,意味着在"生成"和"编辑"两个核心任务上,开源阵营有了统一的标杆。
两个榜单的交叉验证更有信息量
单独看编辑榜或单独看生成榜,都可能被单一维度的优化误导。但一个模型同时在两个榜上拿开源第一,说明它的底层能力是通用的。图像编辑本质上是"理解+生成"的复合任务——你得先看懂原图,再按指令改对地方,同时不破坏其余区域。文生图考的是从无到有的构建能力。两者都强,说明模型对视觉语义的把握已经到位。
7B 权重,一张被低估的牌
参数不大,胃口很大
7B 在今天的模型尺度里不算大。文本领域动辄上百 B,图像领域也在往更大走。但 Qwen-Image-2.1 用 7B 的体量打出了这个成绩,说明架构效率而非堆参数才是关键。对开发者来说,7B 意味着更低的推理成本、更友好的部署条件。一张消费级显卡就能跑起来,这在闭源 API 主导的格局里,是个实实在在的变量。
开放权重改变的是生态节奏
闭源模型发布,你只能用 API,调不了、改不了、也不知道里面发生了什么。开放权重不一样。开发者可以微调、可以量化、可以集成到自己的管线里。通义千问选择开放权重,等于把 Qwen-Image-2.1 变成了一块可以反复切割加工的原材料。这种策略在文本模型上已经被验证过——Qwen 系列的开源版本积累了大量下游衍生模型,形成了一个正循环。
追赶者的身位正在收缩
从 2024 年到现在,图像模型的竞争有一个清晰的趋势:开源和闭源的能力差距在快速收窄。GPT-Image 系列、Gemini 的图像能力、Midjourney 的持续迭代,这些是闭源阵营的护城河。但护城河正在变窄。3 分的差距如果按这个速度演进,再过两个版本,开源模型站上总榜前列不会是新闻。
图像编辑,比想象中更难啃
编辑为什么比生成难
从零生成一张图,模型有完全的自由度。但编辑不一样。用户给一张原图,说"把背景换成雪山"或者"给这个人加一副眼镜",模型必须精确定位修改区域,保持未修改部分的一致性,还要让修改后的结果看起来自然。这中间任何一环出问题——背景换了但光影不对、眼镜加了但比例失真——结果就废了。这就是为什么图像编辑长期是闭源模型的舒适区,也是为什么 Qwen-Image-2.1 在这个榜上拿下开源第一特别有分量。
人类投票暴露的真实需求
Arena 的盲测机制有个好处:它不测你模型的 benchmark 分数,它测的是人在实际任务中的偏好。用户投出来的结果,反映的是"什么样的编辑结果让人满意"。这比跑数据集更接近真实使用场景。1367 分说明 Qwen-Image-2.1 在多数日常编辑任务上的表现已经让人挑不出大毛病,能让人在盲测中反复选择它。
开源模型的差异化空间在哪
跟闭源硬拼通用能力,开源模型短期内很难全面胜出。但开放权重给了另一条路:垂直场景的深度定制。比如电商产品图编辑、游戏美术素材生成、影视分镜调整,这些场景对通用能力的要求可能没那么极致,但对特定风格、特定流程的适配要求很高。一个能微调的 7B 模型,在这个维度上的灵活性是 API 调用比不了的。
通义千问的全模态棋局
从文本到图像的这条路
通义千问最早是文本模型起家,Qwen 系列在开源文本模型里已经建立了相当稳固的位置。从文本扩到图像,再从图像扩到图像编辑,这个路径很清晰。文本能力打底,意味着模型对复杂指令的理解有先天优势——图像编辑里那些"把左边第三个人手里的杯子换成蓝色"之类的精确指令,考验的正是语言理解能力。Qwen-Image-2.1 在这方面的表现,大概率受益于 Qwen 文本模型的技术积累。
开放权重是策略,不是姿态
国内做开源大模型的不止通义一家,但通义在开放权重这件事上一贯比较坚决。这背后有生态考量:开放权重能快速吸引开发者,形成社区和下游应用,反过来给主模型提供反馈和数据。Qwen-Image-2.1 拿下两个开源第一,既是技术能力的证明,也是这套策略的阶段性成果。
接下来看什么
3 分的差距会被追平吗?大概率会。真正值得关注的是追平之后会发生什么。当开源图像模型的编辑能力真正对齐闭源头部,图像编辑这件事的成本结构会发生变化。API 按次计费的模式会被冲击,端侧部署、私有化部署的可行性会提高,围绕图像编辑的产品形态也可能出现新的玩法。Qwen-Image-2.1 的 1367 分,是这个过程里一个值得记住的节点。

