单张 RTX 5090,32 GB 显存,跑 MiniMax H3 的实时视频生成——30 秒片子,23.51 秒出完,吞吐量压到实时的 1.28 倍。这个数字来自 ComfyUI 博客作者的一次实验,他没堆卡、没上集群,只做了一件事:让智能体去把散落在各处的优化手段一条条翻出来、试掉、留下有用的。
视频生成的实时性一直卡在两堵墙上:显存和延迟。H3 这类模型参数量摆在那里,通常要 A100、H100 级别的卡才敢谈"实时"两个字。作者绕开了正面对刚硬件——智能体替他跑搜索,把注意力实现、量化策略、调度方式、缓存复用这些零散技巧批量验证,最后拼出一个能塞进 32 GB 的方案。23.51 秒对 30 秒,意味着生成速度已经跑在播放速度前面,事情从"等一段视频"变成"边生成边看"。
真正值得琢磨的是方法本身。过去调优靠工程师的经验和运气,一次实验换一个结论;现在把搜索过程交给智能体,人在旁边定方向、看结果。这不是模型突然变强了,而是优化这件事的组织方式变了。对做内容的人来说,消费级显卡跑实时视频生成的那扇窗,或许比预想中来得更早。

