NVIDIA 正在把 AI 基建的竞争拉到一个更硬核的维度:单位电力。最新实测数据显示,新一代 Vera Rubin NVL72 在 智能体(agentic)工作负载下,每兆瓦吞吐量比 GB300 NVL72 最高提升 30 倍,每百万 token 成本降低 35 倍。这不是常规迭代的跑分抖动,而是把 AI 工厂的盈亏线从“能买多少卡”挪到了“能承受多少度电”。当所有云厂商都在追逐同一批 GPU 时,谁能把每一度电换成更密集的智能,谁才有资格留在牌桌上。
算力的新计量单位:每兆瓦能干多少活
一块电表决定一个数据中心能活多久
过去比较 AI 服务器,大家看总算力、看显存、看互联带宽。这些指标没有过时,只是不再完整。今天的数据中心首先被电力预算卡住,你申请到的市电额度就那么几兆瓦,能托起多少推理服务,才是一切决策的起点。Vera Rubin NVL72 给出的 30 倍吞吐量提升,意味着同样的电表刻度下,你能跑起的 Agent 会话数量直接升了两个量级。折算成商业回报,那些被电力审批拖住的项目,不再是“等新的能源配额”,而是“等新的服务器到货”。
Agent 工作负载把短板照得清清楚楚
传统 prompt-response 场景一秒钟能结束,智能体却要反复规划、调用工具、读取返回结果、修正下一步。每个任务消耗的 token 数量不是线性增长,而是循环膨胀。此时芯片的空闲率、内存带宽、NVLink 域内的通信效率都会被放到显微镜下。Vera Rubin NVL72 在架构上把这一切重新捏合,所以基准测试的进步在 agentic 场景里被放大成几十倍的收益。换句话说,它的目标不是让单次回答更快,而是让一整串复杂行为完成得更便宜。
30 倍提升,不是同一个游戏里的领先
如果只是快 30%,你可以说制程红利、软件优化。但 30 倍是质变。当每兆瓦吞吐量变成竞争主轴,AI 算力的评价体系就和电力基建深度绑定。以前是“为了性能可以多耗电”,现在变成“在电费上限内,谁能榨出更多有效输出”。规则一变,所有回归测试都得重做。数据中心选址、机柜设计、供电方案,都要围绕一个核心问题展开:每度电最终换来多少可交付的智能体行为。这比“峰值算力第一”更真实,也更难撒谎。
35 倍成本优势,打的不是价格战
token 成本不只看目录价
每百万 token 的成本下降 35 倍,并不是 NVIDIA 把 GPU 单价砍了 35 倍,而是数据中心的总拥有成本被重新分配。单位机柜功率、散热需求、部署密度、运维复杂度,每一样都写进摊销账单。Vera Rubin NVL72 用更少的能耗完成同样多推理,把成本公式里最昂贵的分母——能源——压缩到以前几乎不可想象的水平。这也意味着,所有按 token 定价的 API 服务商,都拿到了一个极富攻击性的调价空间。
推理循环变长,系统的价值才现形
Agent 不会只问一次“天气怎么样”,它会不断追问、比对、自主纠偏。这种长尾请求对系统稳定性的要求远高于普通聊天。一个能压住长循环、低延迟、高吞吐的机柜,才能让下游应用放心地把任务循环交给它。成本降低 35 倍,本质上是把“让 AI 自己多跑几步”从奢侈变成了日常。过去开发者在 prompt 里写“简短回答”,就是怕 token 账单爆掉;现在这条预算曲线变得平缓,产品设计终于可以优先考虑效果。
token 便宜之后,应用逻辑会变
当 token 贵,开发者在 prompt 里抠字眼,在代码里限制 Agent 调用次数。当 token 成本下降一个数量级,产品团队会开始设计更复杂的 Planner、更多工具调用、更长的记忆窗口。价格不只是成本,它还是行为模式的开关。Vera Rubin NVL72 把这扇门推开了一条缝,门后是一整套新应用形态。短期看,是 RAG 检索和 Agent 循环变多;长期看,那些此前被“一次调用要花几美元”挡在门外的自动化流程,都会重新画业务流程图。
电力受限的 AI 工厂,最先接住红利
超算中心的能耗天花板
不少机构拿着大笔预算,真正卡住立项的不是 GPU 供货,而是电力审批。电网给不了那么多兆瓦,机房的制冷和柴油发电机也追不上 GPU 的胃口。Vera Rubin NVL72 的价值在于,它让同一个电力基建上长出更大的有效算力。对这类用户,30 倍吞吐量意味着建设规划的边界被直接拓宽。原先要在“扩园区”和“降规模”之间二选一的方案,现在可以重新评估:同样一栋楼,改改供电架构,或许就能跑出过去不敢想的 Agent 业务量。
边缘部署从此有了新理由
边缘机房的空间和供电更局促,过去只能跑轻量模型。如今同样一个几十千瓦的小型机柜,可能承载以前需要更大功率设备的 Agent 负载。分布式部署、靠近数据源处理,这些原本要向成本妥协的设想,现在可以重新进入方案选型。不是所有场景都要盖超大规模数据中心,高效的单位电力吞吐让中等规模节点变得更有竞争力。尤其对数据主权或延迟敏感的行业,边缘加 Vera Rubin 的组合会成为一个新选项。
规划算力时,先问每兆瓦能跑多少 Agent
新建或扩容数据中心,行业惯例是先算峰值算力,再反推电力需求。这个流程该倒过来:先确定可用电力,再看每兆瓦能产生多少智能体吞吐量,最后倒推需要多少机柜。Vera Rubin NVL72 的出现,让第二项参数第一次有了惊人的上限,也让算力规划从“买硬件”变成“做能源预算”。在同一个电力预算下,你能交付的 Agent 级服务量翻十倍还是三十倍,直接决定商业模式的厚度和竞争壁垒的高度。
别急着把 GB300 NVL72 扔进垃圾堆
上一代产品仍是过渡期最优解
30 倍差距听起来吓人,但市场上绝大多数 AI 服务还在用更早的架构。GB300 NVL72 本身已经是不错的系统,对于尚未跑满现有集群、或者业务以短请求为主的团队,换代的压强并没有那么大。真正该换的是思维:把每兆瓦吞吐量纳入采购评审,而不是等新硬件到货才开始算账。上一代硬件仍然是过渡期的稳妥选择,尤其当供应链、集成经验和运维体系已经磨合完毕时。
真正要改的是采购和定价模型
如果新的效率曲线成立,云厂商的实例定价、IDC 的机柜租赁合同、运营商的电力报价,都会卷入重新定价。过去按 GPU 小时计费的模式会受到挑战,按有效 token 或每兆瓦产出计费会更贴近真实成本。采购者不该只盯着单卡价格,而要盯住单位成本的系统收益。这组 30 倍/35 倍数据,等于给了资方一张新的谈判底牌。谁能先看懂这张底牌,谁就能在下一轮算力合同里占住主动。
先发优势比想象中短
NVIDIA 每代架构的发布节奏越来越快,今天 Vera Rubin NVL72 的领先,可能很快被后续产品追赶。但这种跳跃式的效率红利,会让每次迭代都变成一次竞争窗口。谁能更快把数据中心的供电、制冷、调度软件适配到新架构,谁就能在窗口期内拿到对手拿不到的成本曲线。GPU 是基础设施,基础设施的换血从来不是换芯片那么简单。它牵动机房构造、软件栈、运维能力,甚至组织架构。现在动手适配的人,赢的不仅是 30 倍的数字,而是下一条起跑线上的位置。

