微软近日开源了TauGrid,一个面向Kubernetes的GPU AI工作负载原生平台,采用MIT许可证,相关容器镜像和Helm图表已发布在微软容器注册表上。该平台将平台团队通常需要手工集成的五个组件——tau命令行工具、基于Kueue的排队与准入、基于KubeRay的Ray集群编排、节点级GPU健康监控以及集群与工作负载可观测性——整合为一次Helm安装即可部署。其核心设计在于职责分离:平台团队负责工作空间、队列、计算配置、存储、身份与可观测性,研究人员则通过仓库和CLI提交工作负载,无需直接配置Kubernetes。用户以tau.yaml描述任务,执行tau run后,TauGrid会解析平台策略、渲染Kubernetes Job或KubeRay RayJob,并通过Kueue提交,涵盖提交、排队、执行、监控、恢复和证据记录六个阶段。该工具主要用Go编写,要求Kubernetes 1.30以上集群及GPU节点。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅