一张消费级显卡就能无限延伸出一个可交互的世界,而且延迟只有1.2秒——ABot-World-0在单张NVIDIA RTX 5090上把这个场景做成了现实。它不是一个传统视频生成模型,而是一个动作条件视频世界模型:你按下键盘,画面立刻同步响应,以720P分辨率、最高16 FPS持续滚动,峰值显存仅需约19GiB。整个体系架构完全围绕“交互”重构,采用统一的帧同步键盘动作接口,从根源上区别于那种先出视频再幻想能控制的旧路线。
真正的胜负手在于LongForcing。视频世界模型最怕的不是第一帧质量,而是长程自回归下的累积漂移——跑着跑着世界就畸变崩坏,那是潜伏在所有时序生成模型深处的“癌症”。ABot-World-0在训练阶段直接引入分布匹配,强制模型在前瞻式LongForcing窗口内与真实轨迹对齐,把漂移问题压制在了源头,而不是事后打补丁。这种思路对做具身智能和仿真的人冲击极大,因为长期可交互的世界一致性,比生成几张高保真图像要难得多,也重要得多。
极致优化同样不可或缺。轻量级VAE解码器砍掉了冗余计算,低比特DiT推理把重型Transformer压缩得能喘口气,局部上下文KV缓存则让历史帧信息复用不再每次都从头开始。正是这一套系统级组合拳,才把动辄需要多卡集群的交互世界生成硬生生塞进了单张5090。ABot-World-0证明了一件事:可交互的世界模拟器已不再是数据中心里的奢侈品。当世界模型能以如此低的成本实时滚动,机器人策略训练和数据采集的边界就会被重新丈量。

