视频生成模型突然学会了控制机械臂——这是近来最不按剧本走的技术交叉。Black Forest Labs 刚推出的多模态基础模型 FLUX 3,同时吃进图像、视频和音频,却把超过 95% 的训练算力砸在了 视频预测上。这种看似赌注一边倒的策略,意外让模型底层长出了对物理交互的隐式理解:碰撞、遮挡、重力下的落体,全都编码在像素流的生成逻辑里。当脉冲从屏幕转向实体的奥迪车间,这些“偏科”得来的知识就成了最顺手的基座。
团队与机器人公司 mimic 联手推出的 FLUX-mimic,已经开进奥迪产线接受真刀真枪的测试。把动作预测塞进视频管道的那一刻,生成质量塌了——峰值跌了 10%,像一个突然被要求手脚并用的杂技演员,四肢毫无着落。但只用了 3500 步训练,那股生涩就褪得干干净净,输出画质弹回原位。这说明视频扩散模型对物理结构的把握比预想中稳固得多,稍加轻量微调,视觉智能就能平滑迁移为物理动作。
一个基础模型同时向外喷射像素和关节指令,这远比任何超分辨率指标的提升都更具产业冲击力。FLUX 3 真正的分水岭意义,不在于又刷了哪个基准,而在于它让“通用世界模型”从纸面走向奥迪的产线。当视频生成、音频合成与机器人动作控制共享同一个表征空间,我们逼近的不再是更好的生成器,而是能理解世界的数字代理。物理 AI 的下半场,拼的不再是谁的生成更逼真,而是谁能在同一次前向传播里,既拍电影又拧螺丝。

