Modal 工程师撰文介绍了其为支撑百万级并发沙箱而从头重建的沙箱基础设施。文章指出,Kubernetes 等传统容器编排系统依赖集中式协调与强一致性状态,其调度算法和 etcd 存储的负载随节点与 Pod 数量增长,且 etcd 缺乏键空间分片能力,在高创建率与更替率下易成瓶颈,难以扩展至百万沙箱规模。为此,Modal 放弃全局协调,让每个工作节点成为自身状态的单一数据源,并以并行调度服务器替代串行调度器,通过 RPC 直接请求工作节点创建沙箱,使所有高复杂度组件默认水平扩展。最终架构仅剩 Redis 流一个瓶颈,负载测试显示其在上十万工作进程下仍可行。基准测试中,Modal 在不到一分钟内创建了 100 万个沙箱,启动到运行代码的中位时间不足 0.5 秒。业内评论认为,这一成果的关键在于绕开而非扩展 Kubernetes,也折射出生成式 AI 基础设施对执行层与协调层解耦的新需求。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅