2026 年 10 月 1 日,Modal 在官方工程博客宣布,多节点 GPU 集群产品 Modal Clusters 正式可用(GA)。开发者只需要在 Python 函数上加一个装饰器 @modal.clustered,就能获得一个多节点集群:节点之间通过 InfiniBand verbs 互联,最高带宽 6.4 Tbps,PyTorch 与 NCCL 自动配置好。集群在几秒钟内就绪,费用按秒计算。
一个装饰器之外,还有什么
@modal.clustered 不是孤立的语法糖。Modal Clusters 与 Modal 已有的全部原语打通:训练的 checkpoint 写进 Volumes,数据通过 Cloud Bucket Mounts 挂载进来,任务用 Queues 编排。网络这层最棘手的部分被收进一个开关 rdma=True 里——驱动、环境变量、用户态库这些每个云厂商都不太一样的 RDMA 配置,由平台自动完成,开箱支持 PyTorch + NCCL。
定价上,传统的多节点方案要么按小时租、要么提前预留容量,空转也照收钱。Modal 这次延续了它的 serverless 路线:什么时候跑都行,只为实际使用付费。
背景:1.5 年的工程花在了哪里
Modal 说,过去 1.5 年都在实战打磨这套能力,核心是把调度器和网络栈重做了一遍。
传统调度器是贪心的:每台机器各自轮询任务队列,调度器逐个看有没有合适的活。但多节点调度的原子单位从「一台机器」变成了「一次 N 台」,Modal 为此写了新的 gang scheduler:先纵览整个机群和所有待启动的集群,做一次全局放置规划,再统一行动,把同一可用区的节点划到同一个 RDMA 网络里。
RDMA 本身是出了名的难伺候。Modal 选择了更安全的多租户容器运行时 gVisor,但它没有 RDMA 支持,Modal 就自己给 gVisor 加上,并且把改动贡献回了开源社区。
谁已经在用它
博客点名了三家在测试期里跑在上面的负载:客服智能体公司 Decagon 用它微调过万亿参数量级的开源模型;人形机器人公司 1x 用多节点 B300 集群预训练 NEO 的世界模型,大规模实验时一次能拉起数百张卡;Runway 把最新的视频生成与剪辑模型 Gen-4.5、Aleph 2.0 的多节点推理也放在上面,由自动伸缩器按集群整体扩缩。
谁适合用,谁可以先观望
有多节点训练或推理需求、但不想自建集群运维团队的公司,是最直接的目标用户:大模型后训练、万亿级参数微调、跨节点推理拆分这类任务,原来要么养一个 infra 团队,要么忍受云厂商的排队和预留。
如果你的负载始终跑在单张卡上,Modal Clusters 和你无关;如果你已经有长期包量的自有机房,迁移过去也不一定划算。Modal Clusters 打开的是「按秒租用多节点」这个过去不存在的选项,它的价值首先属于算力需求忽高忽低的团队。