NVIDIA一声不吭就把物理AI的底座又往前推了一步——Cosmos 3来了,而且直接开源。这不是又一个只会聊天的多模态模型。它是一头扎进真实物理世界,把视觉推理、世界生成和动作预测绑在一起的全模态基础模型,架构底子是一套全新的混合Transformer。说它是“世界模型”,不如说它给机器人和自动驾驶画了一张能实时更新的活地图。
Cosmos 3最狠的地方在于统一。过去做具身智能,团队得拿视觉模型、物理引擎、动作规划模型像搭积木一样拼起来,中间全是损耗。Cosmos 3一上来就用全模态输入——图像、视频、文本、传感器流悉数吞下,然后端到端地输出下一步状态和动作候选。基准测试里的表现让老路线很尴尬:在物理一致性预测和长序列规划任务上,得分直接碾压前一代和几个热门的专用仿真器。英伟达还顺手放出了预训练权重和微调工具,也就是说,一个几十人的机器人团队,现在有能力在几周内训出自己的定制化物理AI核心,不用从零烧显卡。
这步棋的杀伤力不在精度,在生态。当物理AI的入场券从一整套复杂系统变成一个大模型加几张卡,仿真的壁垒就被抽走了。制造业质检、仓储搬运、手术辅助机器人,都在同一套模型基座上长出来。甚至可以说,NVIDIA把之前用在语言和图像上的那套开源打法,直接搬进了物理智能的深水区。对那些还在纠结用哪个仿真引擎的团队而言,Cosmos 3递过来的不是选项,是一道省时间的选择题。

