NVIDIA 在 FMS 大会上把 cuFile API 及整个底层存储软件栈全部开源,这事的分量被不少人低估了。过去 GPU 要碰数据,得先经过 CPU 这道门,中间几次拷贝下来,延迟轻易跑进毫秒级。现在 cuFile 让 GPU 绕过 CPU,直接对 NVMe 和网络存储发起读写,端到端延迟一脚踩进微秒区间。这不止是一个性能补丁——它在消除存和算之间那层由来已久的硬边界。
同步放出的还有 Vera CPU 的实测数据:在两级压缩与加密流水线场景下,吞吐量最高达到 x86 CPU 的 3.21 倍。Vera 不是要去抢通用计算的地盘,它专盯存储数据流中那些反复出现的高强度压缩、校验、加密动作,用紧耦合的硬件管线把 CPU 开销打成“背景噪音”。与此同时,NVIDIA 联手 40 多家厂商推出 Storage-Next 计划,直指一个尖锐现实:AI 时代存储不能继续躲在计算后面当安静的仓库。Storage-Next 要的是存力与算力的原生协同,让存储架构从“够用”进到“无感”。
cuFile 开源的关键不在于多了一个可选项,而在于 GPU 直存不再绑定任何单一厂商的实现。基础设施团队评估存储架构时,终于可以用一种面向未来的方式提问:我的存储能否直接喂饱 GPU,而不是围着 CPU 转圈。压缩、加密、直存通路全线打通,算力越强,存储越不能假装自己只是旁观者。

