生数科技把 Vidu S2 摆上台面,视频生成赛道的节奏又被打乱一次。这次不是单模型升级,而是两个方向同时开火:Vidu S2-Avatar 盯住数字角色实时交互,Vidu S2-Editing 瞄准视频流实时编辑。生数科技还提到,正在探索面向 VR 头显的实时空间视频生成与编辑。几条线摆在一起,意思很清楚:视频模型不满足于做离线工具,它要变成实时系统。
实时,才是视频生成的下一个门槛
从“等结果”到“边聊边生成”
过去一年,视频生成模型比拼的多是画质、时长、运动幅度。用户输入提示词,等上几十秒甚至几分钟,拿到一段成品。这套流程适合做短片、广告概念片,却撑不起实时对话。Vidu S2-Avatar 的出现,把问题换了个问法:生成能不能发生在交互过程中?数字角色不再只是预渲染的动画,而是根据用户语音、表情、动作,持续输出下一帧。生数科技把它称为数字角色实时交互,本质是把视频生成从离线任务变成在线服务。离线任务可以慢慢算,在线服务必须一边算一边交卷。
Avatar 要解决的不是像,是稳
数字人早就有了。难的是实时状态下,角色不崩、不漂、不跳脸。长视频生成里常见的身份漂移、口型错位、手势扭曲,一旦放进实时交互,会被放大成灾难。用户说三句话,角色换一张脸;镜头转个角度,衣服纹理突然重组。Vidu S2-Avatar 要啃的硬骨头,是时序一致性和身份保持。生成模型得记住“我是谁”,还得记住“我刚才在做什么”。这比单帧好看难得多。生数科技在发布中给出实时交互的技术路线和评测数字,外界可以对照判断其流式生成思路是否成立。
延迟每降一毫秒,体验就换一层
实时交互的体验曲线很残酷。延迟从 500 毫秒降到 200 毫秒,用户可能只是觉得“顺了一点”;再降到 100 毫秒以内,对话节奏才会真正自然。视频生成的计算量摆在那里,要压延迟,就得在模型结构、推理优化、缓存策略上同时下手。流式生成不是把大模型切成小块那么简单。切片之间要共享上下文,又不能重复计算;要保留历史信息,又不能无限堆积。Vidu S2-Avatar 如果真能把交互延迟压到可用区间,它打开的就不只是数字人直播,还有 AI 陪伴、虚拟客服、游戏 NPC 这些需要即时反馈的场景。
剪辑台正在被数据流冲垮
Vidu S2-Editing 把编辑变成持续动作
传统视频编辑是“暂停—修改—渲染—播放”。Vidu S2-Editing 想做的是“边播边改”。视频流实时编辑,意味着用户可以在画面持续输出时调整风格、替换元素、修改局部内容,而不必等整段视频重新生成。这个方向听起来像剪辑软件的升级,实际上是对视频生成架构的重写。编辑指令不再作用于已经完成的视频文件,而是作用于正在生成的潜在表示或帧序列。生数科技把它和 Avatar 并列发布,说明两条线共享同一套实时生成底座。一个负责生成角色,一个负责修改画面。
流式编辑难在哪
难在一致性。你改一帧容易,改一段也还能靠后处理;但要在视频流里持续编辑,模型必须理解哪些内容该变、哪些内容不该变。把背景换成夜景,角色的光影要跟着变;把衣服换成红色,布料运动不能突然断裂。更麻烦的是,编辑操作可能随时插入。用户看到第 3 秒觉得不对,立刻下指令,模型得从第 3 秒开始改写,同时保证第 4 秒、第 5 秒不跳戏。这要求模型有强时序建模能力,还要有低延迟的指令响应机制。Vidu S2-Editing 的技术路线,大概率围绕流式扩散或自回归生成展开,但真正的考验在工程落地。
创作者的工作流会被重写吗
如果视频流实时编辑成熟,剪辑师的工作会从“时间线操作”转向“实时调参”。导演在监视器前说“这里光再暖一点”“背景换成雨天”,画面当场变化。广告团队可以一边直播一边换包装,游戏主播可以实时改变场景风格。生数科技没有把 Vidu S2-Editing 限定在专业后期,说明它瞄的是更广的创作入口。风险也在这里:实时编辑一旦门槛降低,内容同质化会更快。工具越强,创意越值钱。
VR 头显里的空间视频,生数科技想抢先卡位
空间视频不能只看,还要能改
生数科技在 Vidu S2 发布中埋了一条更远的线:面向 VR 头显的实时空间视频生成与编辑。空间视频不是 3D 电影。它要求画面随头部移动而变化,视差、深度、遮挡关系都得对。实时生成空间视频,等于把视频模型放进一个六自由度环境里跑。用户转头,画面要立刻补全;用户走近,细节要即时浮现。编辑也一样,不能等整段空间视频渲染完再改。生数科技探索这个方向,说明它不满足于做手机屏幕里的视频工具,而是想进入下一代计算平台的内容层。
实时生成与编辑同时发生意味着什么
在 VR 里,生成和编辑的边界会模糊。用户看到一个虚拟房间,觉得墙太亮,直接用手势调暗;觉得窗外风景单调,一句话换成雪山。系统收到指令,不是暂停世界,而是让世界继续运转的同时改变局部。这需要模型同时处理感知、生成、编辑、渲染四条流水线。任何一条卡住,沉浸感就碎了。生数科技把空间视频列为探索方向,而不是已发布产品,态度算克制。这个方向的技术难度比 Avatar 和 Editing 更高,但一旦打通,VR 内容匮乏的问题可能找到新解法。
头显之外,空间视频还需要什么
光有生成模型不够。空间视频要落地,还得看头显算力、传输带宽、显示分辨率、眼动追踪。生数科技做的是内容生成层,它需要硬件生态配合。苹果 Vision Pro 把空间视频推到了消费级视野,但拍摄和制作门槛依然高。如果 Vidu S2 的空间视频能力真能实时生成与编辑,内容生产会从“拍摄现实”转向“生成现实”。这对影视、教育、社交、游戏都是变量。生数科技现在下注,赌的是头显普及后的内容缺口。
这场仗的胜负手不在参数表
对手们都在往实时方向跑
视频生成赛道已经挤满了人。Runway、Pika、可灵、Luma 各占一块地盘,但大家的产品形态仍以“输入提示词、输出视频”为主。实时交互和实时编辑是下一个分水岭。谁先把延迟压到人类可接受范围,谁就能从工具变成平台。生数科技推出 Vidu S2 双模型,等于把战火烧到了实时赛道。它不一定是最早喊出口号的,但它是少数把 Avatar 和 Editing 同时摆上桌的玩家。这种双线布局,说明它看到了底层技术的共通性。
生数科技的机会与风险
机会在于场景。数字角色实时交互可以进直播、客服、教育、陪伴;视频流实时编辑可以进广告、影视、游戏。两个方向都能找到付费方。风险在于工程。实时生成对算力成本极其敏感。如果每次交互都要调用大模型推理,规模化部署会烧掉大量 GPU。生数科技需要在模型压缩、蒸馏、专用芯片适配上给出答案。发布时给出的评测数字能证明技术可行,但商业可行要看单位推理成本。这个账,客户会算。
商业化不会只在创意行业
创意行业是视频生成的第一站,但不是终点。数字角色实时交互一旦稳定,企业培训可以生成虚拟讲师,电商直播可以生成永不疲倦的主播,心理咨询可以生成有记忆的对话对象。视频流实时编辑则可能进入远程会议、在线教育、云游戏。生数科技把 Vidu S2 定义为实时交互、编辑与空间视频的技术路线,而不是几个孤立功能。这种定义方式,暗示它想做的不是又一个视频生成工具,而是实时视觉计算的基础设施。路还长,但方向已经摆明。

