据MarkTechPost报道,NVIDIA已开源Kubernetes原生工作流编排器OSMO,机器人开发团队可用一个YAML文件描述并跨不同算力层级运行物理AI训练、仿真与机器人测试流程,无需修改基础设施代码。该项目采用Apache-2.0许可,在NGC上提供Helm chart和容器,并支持通过KIND在工作站运行完整控制平面。

NVIDIA将物理AI视为“三台计算机”问题:训练在数据中心GB200或H100集群,仿真、物理和传感器渲染在RTX工作站上通过Isaac Sim完成,部署与硬件在环测试在Jetson AGX Thor等边缘设备上进行。每层通常有独立集群、调度器和粘合脚本。OSMO把三层视为一个控制平面的后端,每个后端是通过CLI注册的Kubernetes集群;工作流不指定集群,而指定平台,如gb200、rtx-pro-6000或jetson-agx-thor,由OSMO路由到对应资源池。

仓库典型工作流由数据依赖串联三个任务:simulation在rtx-pro-6000运行Isaac Sim容器;train-policy在gb200用8块GPU运行PyTorch容器并接收仿真输出;evaluate-thor在jetson-agx-thor运行ROS应用,消费训练好的策略并写入命名数据集。依赖来自输入,持久化来自输出,放置来自平台。用户指南涵盖串行与并行任务组、Jinja模板、重试策略,以及带抢占和跨池GPU借用的HIGH、NORMAL、LOW优先级。

OSMO强调可移植性,同一份YAML可在笔记本Docker/KIND、EKS、AKS、GKE、本地或气隙集群运行;6.3.0版增加多提供商deploy-k8s.sh,可在Azure AKS、AWS EKS、microk8s或现有集群部署,并支持MinIO、Azure Blob、AWS S3或自带S3。开发者可在远程GPU节点启动VS Code、Jupyter或SSH会话,进入任务、端口转发并用rsync双向同步文件。调度默认使用NVIDIA KAI Scheduler,6.2.8版加入NVLink拓扑感知放置,6.3.0版支持按组设置exec_timeout和queue_timeout。

数据方面,项目描述带去重的内容寻址数据集,称可降低存储占用10至100倍。但独立osmo dataset CLI和/datasets API已在6.3.0弃用,并计划在6.4移除,替代方案是工作流管理的数据集输出。安全方面,自6.2.8起提供RBAC授权边车、OAuth2代理设备代码登录和身份提供商用户映射;6.3.0在Envoy网关增加TLS终止并支持Azure Workload Identity、AWS IRSA/Pod Identity;6.3.1把默认osmo-user角色收紧到默认池。

仓库还提供AGENTS.md、技能目录和MCP部署指南。NVIDIA在GTC 2026表示,OSMO可与Claude Code、OpenAI Codex和Cursor集成,使编码代理能提交、监控和调试流水线。据MarkTechPost报道,OSMO已在GR00T、Isaac Lab、Isaac Sim和Isaac ROS上经过实战检验,并存在Azure和Nebius集成;最新版本为6.3.1,发布于2026年6月。