混元把参考图上限开到 5 张的时候,最该紧张的其实不是画图工具,是那些只会"一键出图"的工作流。腾讯混元 Hy Image 3.5 preview 上线,文生图、图生图、最多 5 张参考图输入、多轮编辑、最高 2K 输出——单看这份参数表并不炸裂。真正值得琢磨的是藏在后面的一组数字:上百名专业设计师参与 GSB 盲测,这一版对上一代的综合胜率提升超过 30%。
参考图从一张变五张,改的是流程不是参数
为什么"张数"是个硬指标
一张参考图能锁定风格。两张可以拆开主体和背景。五张,意味着你能用一整组素材去约束一个角色的长相、一套配色方案,乃至某种排版气质。做电商详情页、做漫画分镜、做品牌视觉的人看到这个数字会有反应——过去要连抽几百张才碰上那么一次的稳定感,现在能用一组参考图固定下来。被讨论了三年的角色一致性问题,第一次有了工程化解决的雏形。
多轮编辑,把抽卡变成改稿
决定一个图像模型能不能进工作流的,往往不是第一张图有多惊艳,而是第十次修改之后它还听不听话。多轮编辑的意义就在这里:在同一张图上连续下指令,把光调暖一点,把左边那个人挪走,把那行字换掉。难的不是执行单条指令,是每一轮都得保住前面已经确认过的部分。改十次崩一次,设计师就不敢用了,工具立刻从生产力退回玩具。
2K 输出,被低估的那道坎
分辨率外行看数字,内行看稳定性。很多模型标称能出高分辨率,实际一到细节就开始糊脸、糊字、糊边缘。2K 直出的现实意义是:电商主图、海报投放、印刷级物料这些场景不用再走一遍超分,链路短了一截。对设计师来说,少一道工序就是少一次返工风险。
30% 胜率提升,得先弄懂它怎么测出来的
GSB 盲测是什么玩法
GSB 是 Good、Same、Bad 三个选项的缩写。把两代模型的输出随机并排摆开,评测者不知道哪张来自哪个版本,只能凭眼睛投票。这套方法的好处是摆脱榜单分数的绑架,坏处是主观性重、样本少了没意义。上百名专业设计师这个量级,说明腾讯这次是愿意花钱做严肃评估的,而不是拿几组精选案例发通稿。"对上一代提升 30% 以上"这句话,只有放在这个测试框架里读才成立。
设计师的眼睛比榜单诚实
专业设计师和普通用户看图的关注点完全不在一个层面。普通人先看整体像不像、好不好看;设计师会盯着手指、文字笔画、光影逻辑、材质衔接这些地方找茬。让这群人盲测投票,得到的结论往往比自动评测指标更接近真实使用体验。反过来说,这个数字也没那么神——它是相对上一代的提升,不是绝对水平,跨代比对的时候别把它当成绝对实力的证明。
会写字,还得会改字
文本渲染这关过没过
图像模型能不能把字写对,一直是区分"能看"和"能用"的分界线。海报、包装、UI 稿,哪个场景离得开文字?中文尤其难,笔画密集、结构复杂,模型很容易写出形似而神不似的鬼画符。这一版把文本渲染作为能力细节放出来,说明它至少在常见场景下能交出可用的结果。当然,具体到生僻字、多行排版、字体风格控制,还是得自己上手试。
编辑一致性:动了 A 别碰 B
编辑一致性是另一个容易被忽视的指标。用户说"把裙子改成红色",模型不该顺手把背景也换了、把人物脸型也改了。这类失控在早期模型里几乎是常态,改一处崩全局,最后只能重抽。多轮编辑加上一致性约束,解决的正是这个痛点。腾讯在发布信息里点出这一项,说明他们已经意识到,图像编辑的用户体验核心不在生成质量,而在控制精度。
自家产品先当小白鼠
内部实测反馈的价值
多家腾讯内部产品参与了这版的实测,这个细节比参数更值得关注。内部业务线对图像生成的要求通常很具体:广告素材要过审、社交配图要快、游戏概念图要能接着往下画。这些场景给出的反馈,比实验室里的评测更接近真实分布的难题。外部开发者拿到的 API,某种程度上是这批内部需求打磨过的版本。
定价这件事,决定它是玩具还是工具
官方同步给出了 API 定价信息。价格高低直接决定调用方敢不敢把它塞进自动化流程里。按次计费贵到一定程度,用户就会退回到"人工抽卡、挑一张最好的"这种原始模式,多轮编辑、批量参考图这些能力全成了摆设。反过来,价格压下来,才会有团队愿意把它接进批量生产管线,去做那些真正吃调用量的事情。
它现在站在牌桌的哪个位置
对手不是某一款模型
图像生成这条赛道已经很挤了,闭源的有几家海外巨头在跑,开源的社区版本迭代速度也不慢。混元的差异化不在单点能力上,而在整套组合:参考图数量、多轮编辑、中文文本渲染、国内可用的 API 服务。对国内开发者和企业客户来说,可访问性本身就是竞争力的一部分,这一条常常被技术讨论忽略。
接下来该盯什么
preview 这个词意味着还有变量。真正要观察的是三件事:编辑一致性在复杂场景下会不会掉链子,2K 输出的细节稳定性经不经得起放大看,以及定价和配额能不能支撑起规模化调用。如果这三项都过关,它会从一个"可以试试"的模型,变成很多团队工作流里的默认选项。参数表已经给完了,剩下的看落地。

