NVIDIA 发布 CUDA Toolkit 13.4,核心变化是新增 Windows on Arm 支持,将 CUDA 应用开发从原有的 Linux on Arm 平台进一步扩展。该版本还提供对 NVIDIA Rubin 架构(计算能力 107)的预览级功能支持,使开发者可在正式发布前提前移植应用。多进程服务 V3 引入现代化控制层,包括可脚本化 CLI、命名服务器实例、TOML 配置及与 cgroup 集成的 GPU 显存限制,便于在容器环境中精确划分 GPU 资源。CUDA Compute Fabric Transport 为通信库开发者提供以传输为中心的 API,支持通过命名逻辑端点和异步操作在 NVLink 网络上传输数据。CUDA Python 方面,cuda.core 1.1.0 新增纹理与表面编程、NUMA 感知托管内存及类型存根,cuda.compute 1.1 支持对 CCCL 算法进行多架构预编译。CCCL 3.4 在 Blackwell GPU 上实现更快的 warp 专用 DeviceScan,显存带宽利用率最高达 92%,并扩展了单调用 API、批量 warp 归约及 cuda::std 中的 C++ 标准库并行算法。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅