在 QCon 上海站“AI Infra:算力效率决定规模化落地”专题中,Mooncake 社区 Maintainer 马腾博士将分享如何以 Mooncake 支撑高性能强化学习系统。文章指出,强化学习的性能瓶颈不仅来自模型训练,也来自 Rollout 数据传输、经验回放和权重同步。Mooncake 面向 RL 场景构建高性能数据面,通过结构化对象、DataProto/typed-ragged、BufferPool 与 RDMA 优化 Rollout 数据流,并接入 Miles 替代 Ray Object Store,支持同步与 Fully Async 两种执行模式。在权重更新上,它同时支持 NCCL Broadcast、TransferEngine P2P RDMA 和 disk-delta,其中在 Kimi-K2 场景中 P2P 方案实现约 7 倍加速,并支持 TP/PP/EP/DP 异构 Reshard、Store 权重快照及 MoE 稀疏 Delta。这些能力为大规模 RL 训练提供了高吞吐、低延迟、可扩展的数据与权重基础设施,也回应了不同 RL 框架间接口不统一、Ray Object Store 与权重同步易成瓶颈等实践痛点。
QCon上海是全球软件开发领域的技术大会,聚焦架构设计、AI工程化、高性能系统等前沿技术实践,为技术团队提供分享工程经验与行业趋势的平台。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅