NVIDIA 在其技术博客中介绍了 NVLink 6 如何为大规模 AI 工厂提供多层容错能力。文章指出,在动辄数千 GPU 的集群中,瞬时错误、链路老化和节点中断几乎不可避免,任何丢包都可能放大为显著的吞吐损失,因此无损网络是生产级 AI 基础设施的前提。NVLink 6 通过轻量前向纠错、物理层重传和 UPHY 恢复,在硅片层面以近乎零延迟修正信号错误;链路层采用基于信用的流控从设计上消除丢包,并支持链路自主再平衡。NMX 控制器借助“隔离并排空”状态和 NMX 高可用,可在数秒内迁移控制功能,管理 CPU 重置期间数据面仍持续转发。Dynamo 的影子引擎恢复机制将推理容量恢复时间从冷启动的 283 秒缩短至 7.3 秒。NVLink Fusion 则将同一容错栈扩展至第三方 XPU。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅