据 MarkTechPost 2026年10月5日发布的教程,一套围绕 NVIDIA Cosmos3-DROID 数据集的端到端流式机器人学习管道被演示出来。该管道不下载体积达 707 GB 的数据集仓库,而是通过按需访问元数据、Parquet 数据行组和 AV1 视频窗口,完成从数据检查、轨迹分析到多模态行为克隆策略训练与评估的流程。
教程先对 LeRobotDataset v3.0 结构进行内省。它列出仓库中的文件,统计 success 和 failure 下 data、videos、meta 的文件数量,并识别 success/data 下的 Parquet 分片、指定视频键 observation.image.wrist_image_left 下的视频分片以及 meta 文件。教程读取 info.json,获得总 episode 数、总帧数、任务数、fps,以及 data_path 和 video_path 模板;随后列出 observation.state、action 和视频特征,并从 tasks.parquet 构建任务字符串映射,还读取 episodes 表以了解 episode 索引、长度、data/chunk_index 和 data/file_index 等列。
接着,管道使用 HTTP byte-range 访问配合 PyArrow,选择性地读取 Parquet 行组和列,而不是先下载完整仓库。单个 episode 被转换为状态-动作轨迹,用于分析关节运动、夹爪事件、笛卡尔末端执行器路径和动作频率谱。视频部分通过基于 seek 的 PyAV/FFmpeg 访问,只解码所需的 AV1 视频窗口。教程随后使用数据集统计量对观测和动作进行归一化,构建 ACT 风格的 PyTorch 分块数据集,该数据集可选加入视觉条件,并用于训练多模态行为克隆策略。
教程给出的配置包括:数据集仓库为 nvidia/Cosmos3-DROID,根目录为 success,视频键为 observation.image.wrist_image_left,帧率为 15,使用 48 个 episode,预测时域为 8,观测历史为 2,启用视觉输入,可视化 episode 数为 6,输入视觉尺寸为 96,训练轮数为 12,批大小为 256,随机种子为 0,计算设备在可用时选择 CUDA,否则使用 CPU。教程还给出必要的依赖安装命令,包括 huggingface_hub、pyarrow、av、pandas、matplotlib、tqdm、numpy、torch 等。
在评估阶段,学习到的策略通过开环 rollout 执行,动作块采用时间集成方式。教程报告每个关节的 MSE 和 R^2,并与平均动作基线进行比较,同时可视化预测动作与真实动作,最后保存完整策略检查点以供下游使用。据 MarkTechPost 的教程,这一流程旨在避免本地保存 707 GB 仓库,同时仍然覆盖机器人学习中的数据处理、策略训练和评估环节。