眨眼之间,网页替你变了样。没有前端工程师敲代码,也没有图层叠加的痕迹,屏幕上的界面像被施了魔法一样逐帧换新——这是Runway刚刚发布的Solaris,一个界面世界模型,也是它全新系列的首个作品。放在两三年前,AI生成界面还停留在“画一张好看的图”的水平;如今,Solaris把这件事推到了另一个维度:实时、动态、可交互,而且不写一行代码、不出一张切图。它生成的不是设计稿,而是界面本身。
先不谈应用,聊聊它为什么不写代码
像素就是界面本身
传统AI界面生成分成两派:一派输入文字生成HTML和CSS代码,交付给前端工程师去缝补;另一派直接出图,交付的是一张漂亮但僵硬的设计稿。Solaris选择了第三条路——把图像直接当作交互层。模型内部没有一个类似代码的中间表示,用户看到的像素就是它理解的界面状态,用户的每一次点击、滑动,都会触发下一帧界面状态的生成。
这个概念听起来抽象,其实不难懂。你在浏览器里看到的任何一个页面,在传统架构下都是代码经过渲染管线解码的产物;Solaris跳过了代码解码这一环,让模型直接计算界面下一个状态长什么样。没有DOM树,没有CSS选择器,没有event loop,天然跨平台——这不只是一个技术选择,更是一种全新的软件构建哲学。
没有中间商:状态与事件的直接映射
为什么Runway敢扔掉代码?原因在于,代码这个“中间商”正在成为生成质量的天花板。从海量视频和界面截图里学到的界面运行规律,远比生成HTML标签再交给浏览器渲染更接近人类感知界面的真实方式。世界模型的核心思路本来就是这样:不显式建模规则,让模型从观测中内部学习动态规律。Solaris把界面的状态空间当成一个可交互的“世界”,事件驱动状态迁移,用视觉信号直接模拟整个过程。
这带来的结果是,它不必拘泥于某套前端框架、某个设计系统的细枝末节。栅格、圆角、阴影、交互动效,全部统一在神经网络的参数里,以一种像素级别的“肌肉记忆”被重新表达出来。
实时渲染不是一个功能,是个门槛
只做到静态界面并不新鲜,市面上已经有太多能从文本生成UI图片的模型。Solaris真正的分水岭在于“实时逐帧”。当你点击一个按钮,模型需要实时推算界面进入下一状态后的完整像素画面;你连续快速滑动,它得跟上你的手速,不能卡出令人眩晕的残影。实时生成的背后是推理成本的硬约束,也是产品能否被真正当作“界面”来用,而不只是“图片生成器”的边界。
换句话说,实时两个字,是Solaris从“玩具”跨到“工具”的第一道门槛。这也是把这类模型称作“世界模型”而非“图像生成模型”的原因——它必须像游戏引擎一样,持续输出连续、合理的状态序列。
从生成界面到训练智能体,两个场景已经落地
给人类用的设计引擎
如果把Solaris放到产品经理和设计师面前,它的第一个身份是一台可以对话的界面引擎。你说出一个想法,它给你一个能点、能跳转、能响应状态的交互原型。和Figma里拖动组件不同,这里没有图层、没有画板,只有一段流畅的界面演示。视觉化、动态响应、开放式交互,这三项能力绑在一起,已经覆盖了从头脑风暴到交互验证的绝大部分环节。
当然,它同样适合那些不用像素级严谨的内容场景。比如把一篇博客直接生成一个可滚动阅读的信息页面,根据内容结构实时排版。这类场景容错率更高,反而是Solaris短期内最可能迅速落地的地方。
给Agent用的动态训练场
更值得关注的是它在智能体训练中的位置。今天训练一个能操作网页的GUI Agent,主流做法是给它喂静态页面截图配上动作标注。问题是,真实软件界面的布局千变万化,以静态样本训练出来的智能体,一遇到没见过的界面就容易当场失灵。Solaris提供了一个持续生成、无限变化的界面环境。Agent可以在它生成的动态界面里反复试错,学习“界面的运行逻辑”,而不是背诵某一款应用的固定布局。
这样的训练成本比真实环境采集低得多,覆盖的场景却更广。它意味着通用界面操作智能体可能不再需要依赖成千上万的真实网站采样,也能具备跨应用的泛化能力。从这个角度看,Solaris不只是在做界面生成,也是在为更底层的方向铺路——让智能体在模拟的界面世界里完成“驾照训练”。
文本渲染短板,藏着一个结构性难题
文字渲染为什么这么难
Runway在官方技术说明里没有回避一个问题:文本渲染。界面里的文字要求一笔一画严格对应,一个字写错,用户马上意识到。对视频生成模型来说,画面里飘过的文字稍微模糊一点还能糊弄过去;对可交互界面来说,错字意味着用户可能点错按钮,更可能直接摧毁对整个产品的信任感。
文字识别和生成在端到端视觉模型里本来就是一个难点,因为这要求模型对字形结构做精确到像素的表征,而当下生成式模型的概率采样机制更擅长“画一个大概”而不是“写一个准字”。
没有代码,也就没有“报错”
代码世界有一个好处:错误是可定位的。编译不过、运行报错、单元测试失败,工程师拿到的是一堆明确信号。Solaris直接生成像素,界面的“正确性”失去了客观参照物。比如,用户点击登录,模型生成了一个跳转到个人中心的界面,但模型是怎么知道当前用户的登录状态和权限的?它只能依靠上下文去猜测。一旦猜错,传统软件工程里所有围绕代码的纠错手段都够不着它。
这不是在否定Solaris的技术方向,而是提醒一件事:当界面脱离代码,软件的“测试”和“调试”也需要一套全新的范式。不管是谁,如果带着传统工程化的预期去使用它,早晚会碰壁。
算力账单决定能力边界
另一个容易被忽视的现实是成本。实时逐帧生成意味着——用户每一次点击、滚动、输入,都对应一次模型推理。一次会话下来的算力消耗,远超一张静态图片的推理开销。如今大模型推理价格虽然一直在降,但距离“每个网站都用世界模型代替浏览器渲染引擎”还有不小的距离。
所以短期内,Solaris更适合高价值场景的增量应用,比如交互原型的高保真验证、Agent训练环境的搭建,或者创意工具的快速demo。真正替代整个前端渲染管线,还差着一张不断下降的算力账单和一轮针对交互模型的专门优化。
一场界面生产的范式转移
从设计到运行的合流
传统软件团队里,设计和开发是两种语言。设计师交付稿子,工程师搬运成代码,中间损耗从来没有被真正消灭过。Solaris这类模型第一次让设计稿本身成为运行态,把“设计”和“实现”缩成了一个动作。模型吃下你的描述,输出可直接交互的界面,你改一句话,界面跟着变。这带来的不仅是效率变化,更会重新分配团队里的角色权重——设计师的审美判断,将直接成为产品品质的底线。
别急着欢呼,先看落地
作为一个刚发布的研究预览,Solaris距离进入主流商业链路还有一段路。文本渲染有待精进,企业级应用缺乏安全机制,算力成本尚未明牌。但它的方向已经足够清晰——AI生成的边界,从一张好看的图扩展到一个能跑起来、能交互、能训练智能体的界面世界。
这几行字说得很轻描淡写,背后却是几千亿参数在替你处理每次点击之间的因果。作为这一代做产品的人,你有理由对Solaris保持一定程度的谨慎,更有理由去关注它接下来的每一步——因为你正在见证的,是界面从“写出来”到“长出来”的那个拐点。

