NVIDIA 指出,GPU 集群即使所有健康检查通过,仍可能在运行大规模 AI 训练任务时出现性能下降或失败,原因往往是个别 GPU 缓慢、链路在负载下退化或配置不当,而这些问题通常要到任务运行数小时后甚至客户报障时才被发现。为此,NVIDIA 推出开源 Kubernetes 控制器 Cluster Readiness Engine(NVCRE),通过在实际生产负载到来前运行真实的分布式工作负载,对拓扑感知的节点组进行验证,从而提前定位问题节点。该控制器采用 Certification、Workflow、Job 三层 API,可将故障归因到具体节点及类别(如 NCCL 通信或 NeMo 预训练),并借助自适应故障隔离自动拆分失败节点组、反复重测,最终锁定少量可疑节点,而非牵连整组。NVCRE 还与 NVIDIA AI Cluster Runtime 和 NVSentinel 集成,构成 DSX OS 运维层,使集群就绪状态从假设变为可验证的属性。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅