NVIDIA Topograph 是一款面向 AI 工厂的拓扑感知调度工具,旨在解决 GPU 工作负载因放置不当而导致的性能与能效损失问题。它通过云 API 或本地网络架构系统自动发现集群拓扑,将其归一化为统一模型,并以 Kubernetes 节点标签、Slurm 配置或 Slinky ConfigMap 等格式发布,供调度器直接使用。当集群发生变化时,Topograph 会持续重新生成拓扑视图,无需人工维护。该工具支持 Google Cloud、Lambda、Nebius、Nscale 和 Oracle Cloud Infrastructure 等云平台,本地环境则覆盖 InfiniBand、Spectrum-X 和 Multi-Node NVLink 域,并与 KAI Scheduler 集成实现拓扑感知的 gang 调度。运维人员可通过 Helm 在 Kubernetes 上部署,或在 Slurm 集群上以原生包安装,还可借助模拟工具在无生产硬件的情况下进行测试。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅