NVIDIA 开源了 OSMO,一个 Kubernetes 原生的物理 AI 工作流编排器,旨在解决机器人开发中的“三计算机问题”:策略训练在数据中心 GPU(如 GB200、H100)上完成,仿真测试在 RTX 工作站上进行,而部署与硬件在环验证则运行于 Jetson 等边缘设备。以往这三个层级各自拥有独立的集群、调度器和胶水脚本,交接环节容易积累大量定制代码。OSMO 将三者统一为单一控制平面下的后端,用户只需编写一个 YAML 文件,通过指定平台(如 gb200、rtx-pro-6000、jetson-agx-thor)即可让任务自动路由到对应资源池,无需在代码中指定具体集群。其典型工作流由数据依赖串联仿真、训练与评估三个任务,并支持串并行任务组、Jinja 模板、重试策略及优先级抢占与 GPU 借用。OSMO 采用 Apache-2.0 许可,提供 Helm chart、NGC 容器及本地快速启动方案,降低了物理 AI 流水线的部署门槛。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅