视频生成模型烧了一年的钱,卷了一整年的画质和时长,终于有人把战火烧到了价格和开源上。而且出手的不是小厂,是刚完成大额融资的 MiniMax。他们前天扔出来的 MiniMax H3,几乎把「全模态生成」那张牌桌重新洗了一遍——文字、图像、视频、音频四种输入全吃,直接输出 2K 分辨率、15 秒、带原生立体声的视频。更狠的是,2K 下每秒生成成本压到了主流模型的不到三分之一,还宣布这玩意儿近日要开源权重。闭源视频模型躺在美金上收 API 调用的好日子,可能真的要被打乱了。
全模态、2K、原生立体声,这次没再缺腿
把四种信号吞下去,吐出一个完整的世界
过去的所谓多模态视频生成,很多时候更像是在不同的流水线上分别处理文本、图像,再强行拼装到视频上。音频更是彻头彻尾的局外人——画面有了,声音还得靠后期自己贴。H3 把这件事彻底整合了。它不是一个「文本到视频」模型,而是一个真正意义上联合理解多路信号的生成系统。你可以给它一段文案、几张产品图、一条参考音频,它直接输出一段带环境声、有节奏感、画面风格统一的 2K 成片。这种完整度对广告创意、电商视频、短视频运营的冲击是直接的,因为省掉的不是渲染时间,是来回切换工具、反复对齐版本的人力。
指令跟随,从玄学变成了工程指标
用过早期视频生成模型的人都懂那种挫败感:Prompt 写了一长段,结果画面里重点元素要么失踪,要么位置乱飘。H3 的指令跟随能力被单独拎出来强调,不是没有原因。在内部测试中,它已经能可靠地在指定位置、指定时序插入文字和品牌标识,并且保持与整体画面一致的透视和光影。这意味着,过去那种「多跑几次总有一次对的」抽卡式工作流,终于有机会变成可控的工程化输出。对于需要批量生产视频的团队来说,这项改进比分辨率从 1080p 升到 2K 还要值钱。
价格打骨折,再丢出一张开源牌
每秒钟成本低到可以把「试错」当饭吃
MiniMax 给 H3 定的价格,说实话,粗暴得很。2K 分辨率下每秒成本低于主流方案的三分之一;768p 下甚至比主流 720p 的半价还低。把数字翻译成人话:过去生成一条 10 秒 1080p 视频的费用,在 H3 上能跑三条 2K 成片,还能剩点零头。这种定价策略,本质上不是在促销,而是在重新定义整个品类的成本基线。创作者不必再精打细算地攒 Prompt,先出十几版粗剪再挑,试错成本降到几乎可以忽略。当「生成一次」比「喝杯咖啡」还便宜时,创作逻辑会从「谨慎采购」变成「大量探索」,这个转变对生态的影响比任何单一的功能提升都要深远。
开源权重这一步,踩在了闭源体系最软的地方
如果说压价是正面冲锋,那计划开源模型权重就是绕后包抄。MiniMax 说这是为了支持开源社区、加速硬件兼容,但明眼人一看就知道,这是在动摇闭源视频模型的护城河。权重一旦开放,开发者就能本地部署、针对特定场景微调,比如只做美妆、只做汽车、只做游戏宣传。这些长尾但高价值的垂直场景,闭源 API 永远无法灵活覆盖。更致命的是,开源还会催生一波社区驱动的优化,把模型塞进消费级显卡,让 H3 跑在更多边缘设备上。对竞争对手而言,这意味着一觉醒来,不仅要应对一个价格屠夫,还要面对一个正在疯长的开发者生态。
文字、品牌、动作迁移,这次打的是商业化的七寸
让 Logo 和文字准确落地,是在解一个老难题
视频生成模型里,文字渲染一直是个重灾区。要么笔画粘连成一团,要么色彩和背景混为一体,更不用说保持品牌标准字体和色号了。H3 在文字与品牌呈现上专门做了强化,从已公开的 demo 来看,它可以在场景中稳定嵌入特定字体的品牌名、广告语,并跟着镜头移动合理变形、受光。这对电商和品牌方而言,等于直接打通了「AI 生成 → 可直接投放」的最后几十米。过去需要人工逐帧修文字的痛点,被模型自身消化掉了,这个动作的价值远不止省了几个合成师,而是让视频生成的 ROI 算得过来了。
V2V 动作迁移配上 15 秒,刚好切出商业短片的新口子
V2V 动作迁移并不是新概念,但 H3 把它和 15 秒时长、2K 分辨率打包在一起,完成度就完全不同了。你可以输入一段真人舞蹈,迁移到虚拟角色上,同时通过文本控制服装、背景的变化,再配上原生立体声。15 秒,不多不少,是抖音、Reels、YouTube Shorts 上一个完整叙事的时长。MiniMax 显然不是在拼「最长能生成几分钟」,而是在拼「这一步生成的,能不能直接上架见用户」。这种实用主义的产品思维,在习惯于刷参数榜单的行业里反而显得稀缺。
H3 的出现,像是一张同时打了价格、能力、开放度三张牌的明牌开局。它没把希望寄托在悄悄超越对手上,而是直接把「生成视频」这件事的成本和门槛往下砸了一整个台阶。对于还在靠高价 API 和闭源生态吃饭的厂商,这个信号已经再清楚不过:要么一起把价格打下来,把能力打开,要么等开发者和用户用脚投出下一轮票。

