一个装饰器就能换来一整个多节点集群,Modal 这次把分布式训练的最后一层脚手架也拆了。Modal Clusters 正式可用,开发者只要在函数上写 @modal.clustered,背后就是一整片通过 InfiniBand verbs 互联的机器,节点间带宽最高 6.4 Tbps。PyTorch 和 NCCL 的配置由平台自动完成,没人需要再去手写 rank、拼 hostfile、逐个调环境变量。
别小看"自动配置"这四个字。多机训练真正耗人的从来不是模型代码,而是让几十张卡彼此认得、步调一致。NCCL 的拓扑探测、IB 网卡的 verb 通道、PyTorch 的进程组初始化,任何一环错位,任务就卡在启动阶段空转,工程师只能对着日志猜。Modal 把这些塞进了运行时,摆在开发者面前的仍然是一个函数,只不过它跑在跨节点集群上,通信走的是 RDMA 而不是以太网。
Modal 的打法一直很清楚:复杂度留在平台,接口留给 Python。Clusters 上线意味着它从单机函数迈进了真正的多节点训练场景,也和那些要你自己管集群的 GPU 云划出了界线。但 6.4 Tbps 是链路能力,不等于你的模型一定吃得到——并行策略切得不好,再宽的网也喂不饱机器。更值得看的其实是另一件事:当扩缩容、容错和拓扑调度都被藏进一个装饰器之后,训一个大模型,还剩多少属于工程,多少属于研究。

