具身智能的数据价值,最终要由机器人在新物体、新工位和异常状态下的表现来证明。摄像头记录了多少小时,只是输入规模;这些记录能否还原任务、约束动作并支持独立评估,才决定训练价值。壹典的判断是:下一阶段的数据竞争,将越来越集中于观测、动作、语义与验证之间的衔接能力。本文沿着第一人称采集、分层标注、数据集组织和 GR00T 适配展开,给出面向工程落地的分析。
一、先定义数据要教会机器人什么
规划具身智能数据集时,应先区分四类监督。人类第一人称视频提供任务过程、物体关系和操作顺序;机器人遥操作同时提供传感器观测与控制指令;手持采集器把人类操作约束到较接近机器人的末端接口;仿真可以提供可控环境中的状态、动作与事件。它们覆盖的信号不同,混合比例应由训练目标和验证结果决定。
以“把指定零件放入对应料盒”为例,视频能展示零件被拿起、移动和放下,却通常不能直接给出机械臂的关节目标、夹爪力矩或实际接触力。手部姿态重建增加了几何信息,仍需解决人手与夹爪形态差异、可达空间、控制器约定和接触约束,才能形成可执行监督。
因此,数据目录需要明确区分实测值、人工标签、算法估计和仿真真值。每种来源应保留生成方式、可信度与适用用途。若把推断的手部接触事件标成实测力信号,或把事后推断的轨迹当成真实机器人控制命令,训练损失即使下降,也难以解释模型学到了什么。
我们建议以“通过验收的任务片段及其覆盖范围”作为数据运营的基本单位:除了完整成功轨迹,还要保留失败起点、恢复尝试和人工接管原因。这能让补采围绕能力缺口展开,而不是继续堆积同一操作者、同一工位上的相似动作。
二、Ego 硬件选型:由所需信号反推设备组合
本文的 Ego 指 egocentric,即第一人称采集。头戴或眼镜相机适合记录视线附近的场景与手物交互;胸戴设备能降低部分头部转动影响,但可能漏掉贴近身体的动作;腕部相机更接近末端操作区域,但上下文范围较小。实际选型应让目标动作在关键阶段保持可见,并验证穿戴位置是否改变了操作者的自然行为。
硬件清单应覆盖成像、惯性、几何与接触四组需求。成像关注视场、曝光、快门类型、运动模糊和手部遮挡;IMU 关注采样时间与相机的关系;深度或双目关注工作距离、反光件与弱纹理区域;手部追踪、数据手套、夹爪编码器及力/触觉传感器,分别提供不同层面的运动或接触信息。需要哪一种,应由任务中的不可观测量决定。
设备验收还应检查原始时间戳、标定参数、导出格式、掉帧记录、散热、续航、存储带宽和长时间佩戴稳定性。只拿到压缩视频而拿不到时钟与标定信息,会增加后续轨迹重建的不确定性。对于插接、拧紧等接触敏感任务,应优先确认力与控制反馈的采集能力;仅提高相机分辨率不能补齐这类监督。
三、两个具体参照:Aria 研究眼镜与 UMI 手持采集
Project Aria Gen 2 展示了一类多传感器研究设备的设计:官方硬件文档列出 RGB 相机、4 个计算机视觉相机及 2 个 IMU;其中 RGB 使用滚动快门,计算机视觉相机使用全局快门。[1] 这提示选型时必须逐个传感器核对曝光与运动成像特性,不能用整机的一个“高帧率”指标概括所有流。
还要区分传感器能力与实际采集配置。Aria 官方配置表中,profile10 的 RGB 为 30 Hz、2016×1512,profile8 则为 10 Hz、2560×1920;规格表列出的 IMU 采样率为 800 Hz。[2] 项目应保存所用 profile 与各流的实测有效频率,并核验导出结果。把最高分辨率、最高帧率和最长续航拼成一组承诺,缺乏工程依据。
UMI(Universal Manipulation Interface)走的是另一条路线:用带相机的手持平行夹爪收集示范,并把相对轨迹表示与推理时延匹配纳入策略接口设计。[3] 它的启发是让采集接口主动接近目标操作接口。眼镜更有利于观察自然行为,手持夹爪则限制了人手的自由度;二者适合不同数据目的,不宜把任何一种采集方式的成功结果直接外推到灵巧手、多接触装配或全身控制。
四、时间同步:先对齐物理事件,再对齐文件行
多模态对齐首先是时钟问题。Aria Gen 2 的官方教程区分 DEVICE_TIME 与 HOST_TIME:前者对应设备采集时间,后者对应数据保存时间;跨设备时间戳需要映射到可比较的时间域。[4] 在机器人系统中,相机曝光、IMU 测量、状态上报、指令发送和控制器执行,也应分别记录其时间含义。
建议保留原始时间戳与单调时钟映射,估计固定偏移和运行中的漂移;随后按训练需要生成同步视图,并记录每次匹配的时间残差。观测应遵守推理时的可见性:使用“最近帧”时,如果选中了决策时刻之后才产生或到达的图像,就可能引入未来信息。离线重建可以使用后续数据,但该结果能否作为策略输入,需要另行判断。
一个构造计算可以说明量级:若手或夹爪以 0.5 米/秒匀速运动,视频与动作错开 33 毫秒,对应位移约为 16.5 毫米。这不是实验结果,也不是通用验收阈值;它说明时间误差需要与动作速度、装配间隙和任务后果一起评估。报告应给出残差分布与异常片段,而不只写“所有设备设置为 30 FPS”。
高频原始流与策略采样率应分开管理。把 IMU、机器人状态和相机统一导出到一个固定网格,需要明确重采样方法、缺失值、插值跨度与抗混叠处理。重复上一帧可以是显式的缺失处理策略,但不能悄悄把它计为新的有效观测。
五、空间标定与动作语义:从人手到机器人还有几层转换
空间链路至少涉及相机、穿戴设备、场景或世界、机器人基座、末端工具几个坐标系。Aria 的标定文档提供相机/IMU 内参与设备内传感器外参,这些出厂信息解决的是设备内部关系。[5] 当设备进入具体工位,还需要建立它与机器人及场景之间的关系,并记录标定版本、时间和安装状态。
可采用清晰的变换记法:T_A_B 表示把 B 系坐标转换到 A 系,则 T_base_camera = T_base_world × T_world_device × T_device_camera。手部点还需使用与其输出坐标系一致的变换。每条链都应注明长度单位、左右手系、轴方向、四元数顺序与时间有效性;以重投影检查和可测量参照物验证方向,避免“轨迹看起来大致正确”掩盖镜像或尺度错误。
动作语义需要同等明确。action 可能表示关节位置、关节速度、末端目标位姿、相对位姿增量或夹爪开度;observation.state 则应说明实际测量状态。发送目标与实际达到的状态之间可能有延迟和跟踪误差,不能互相替代。相对动作还必须注明是相对当前观测、上一目标还是动作块起点,旋转的相对变化也不能任意逐项相减。
人类轨迹重定向到机器人时,应把手腕与指尖估计转换为目标末端约束,再检查逆运动学、关节限位、碰撞和速度约束。被裁剪、求解失败或接触状态不明确的片段要保留标记。更平滑的重建轨迹可能隐藏真实犹豫与接触事件,采集团队应同时保存原始证据和处理后的训练视图。
六、标注体系:任务、事件、几何和控制分层管理
我们建议把标注设计成可组合的层级。任务层说明目标、对象、起止条件和成功标准;片段层记录一次尝试的边界、场景、操作者、设备与本体;子任务层描述接近、抓取、搬运、对准、释放等阶段。边界规则应基于可观察证据,例如“物体开始随夹爪共同运动”,而不是仅凭某一帧中两者距离很近。
事件层记录接触、滑落、重抓、人工介入和终止原因;几何层按需要记录物体框、分割、关键点、手部关节与位姿;控制层关联真实指令、反馈和力/触觉流。并非每个项目都需要完整六层,应该先确定训练目标,再决定标注投入。没有传感器支撑的力值,应标为未知或估计,不能由标注员凭视频填写确定数值。
每个关键标签最好带时间区间、对象标识、来源、置信度、标注规范版本和复核状态。左右手、遮挡、离开视野、跟踪丢失必须有独立表达,不能把未检测到误写成不存在。空间关系还需定义参照:指令中的“左侧料盒”是操作者左侧、相机左侧还是机器人基座左侧。
自动模型适合提出候选分割、轨迹和事件,人工重点复核长尾与高代价错误。验收应分别观察事件时间边界偏差、对象身份切换、关键点误差、任务标签分歧和失败原因漏标,报告分母与样本分层。一个汇总“标注准确率”无法解释哪种监督可用于训练。
后验语言也要避免泄漏。如果模型需要根据当前画面决定抓哪个零件,输入标注就不应包含“随后成功抓取右侧零件”这类未来结果。成功/失败标签可以用于评估、筛选或特定训练目标,但其进入模型的时刻与角色必须显式定义。
七、数据质检:重点检查覆盖、独立性和可恢复性
数据质检应同时覆盖信号与业务。信号侧检查解码失败、时间不单调、跨流偏移、重复帧、状态越界、跟踪跳变和缺失片段;业务侧检查物体类别、背景、照明、操作者习惯、失败类型与任务阶段是否覆盖预期使用环境。某个关键接触阶段全部被手遮挡,即使总体清晰度很高,也可能无法支撑目标学习。
训练集与测试集应按照真正要考察的泛化能力隔离。若目标是适应新工位,应保留整个工位;若目标是新物体,应按物体实例或类别组织评估;同一次操作的相邻帧、不同相机视角、裁剪版本及其合成衍生数据,应通过来源关系管理,避免随机拆分后分别进入训练和测试。
来源关系还包括加工谱系:原始录像、重建轨迹、标注版本、格式转换与合成种子之间,应有可追溯映射。关于划分与版本管理的通用方法,可结合壹典此前的训练数据集验收文章阅读;具身数据则需要进一步把时间、空间和本体配置纳入同一份交付记录。
我们建议分开报告原始采集量、自动检查通过量、人工复核通过量、实际进入训练的片段量,以及各任务条件的分布。失败轨迹不必全部丢弃,但要按用途路由到恢复学习、失败检测或诊断集合;没有区分地加入成功行为克隆目标,可能让模型同时模仿相互冲突的动作。
八、LeRobotDataset v3.0:改变的是物理存储与片段索引
LeRobotDataset v3.0 的核心变化,是把多个 episode 聚合到较大的 Parquet 与 MP4 文件中,再通过元数据恢复每个 episode 的边界;逻辑上的一次示范与物理文件不再一一对应。低维状态/动作、相机视频和关联元数据共同构成数据集。[6] 这有助于管理大规模数据,但不能替代上游的时空校准。
官方迁移指南展示的典型布局包括 data/chunk-000/file-000.parquet、videos/{camera_key}/chunk-000/file-000.mp4,以及 meta/episodes/chunk-000/file-000.parquet。meta/info.json 描述特征、帧率及路径等信息,meta/stats.json 保存统计量,任务映射使用 meta/tasks.parquet。[7] episode 边界与视频定位必须跟随元数据解析,不能再凭一个文件名推定完整示范。
核对文档与代码时,还能看到版本演进留下的差异:部分概览文字仍列出 tasks.jsonl,而当前数据集工具代码将 meta/tasks.parquet 定为默认路径,并把 tasks.jsonl 标为旧格式路径。[8] 工程上应冻结所用 LeRobot 版本或提交,与实际读写器及样例文件一起验收,避免混用不同时间的教程。
建议在标准数据集之外或受支持的扩展中保留原始传感器归档、标定、授权依据、标签规范和处理谱系,并明确哪些字段由标准加载器读取、哪些属于项目约定。用同一个 episode 标识连接这些材料,比把无法解释的额外数组塞进 action 更利于后续审计与重训练。
九、格式迁移验收:能加载只是第一关
迁移前后应逐项比对 episode 数、逐片段长度、任务索引、首尾时间戳、状态/动作维度和各相机的对应关系;再抽查首帧、末帧、片段交界和随机中间帧。若视频进行了有损重编码,逐字节哈希不应被误用为画面等价的唯一标准,应验证帧序、时间位置与可接受的视觉误差。
训练样本通常还包含历史观测与未来动作窗口。靠近 episode 末端时,要确认窗口不会读入下一次示范,并让填充掩码参与相应损失处理。若改变了采样率,固定“16 步”代表的真实时长也会变化;状态与动作的归一化统计、有效通道以及缺失值处理,必须和转换后的语义一致。 用于训练预处理的统计量应在训练划分上拟合,冻结后应用到验证与测试,避免把留出数据的分布信息带回训练。
数据制作结束还需要关闭并完成写入器。LeRobot v3.0 文档要求在相关创建/录制流程完成后调用 finalize(),确保缓冲数据和 Parquet 元数据完整落盘。[6] 我们建议把“重新打开数据集并抽样回放”设为交付检查,以发现文件存在但索引、页脚或视频定位不可用的问题。
十、GR00T 的位置:把多模态条件变成一段动作
截至本文核验时,NVIDIA 官方仓库与 LeRobot 集成文档均已介绍 GR00T N1.7。其模型卡描述了以视觉、语言和机器人自身状态为条件,通过 flow matching action transformer 生成动作块的方式。[9] 因而,数据接口既要说明机器人看到了什么,也要说明它处于什么状态、接受什么任务以及动作向量应如何解释。
N1.7 官方仓库说明了相对末端动作表示及人类视频参与预训练的路线。[10] 这为跨本体共享操作先验提供了研究方向,但企业自己的第一人称录像仍需要适配到可用监督。手部估计精度、物体接触、机器人可达性和目标任务分布,仍会限制迁移效果。
动作块预测需要与实际控制闭环一起设计。一次预测未来多个动作,不意味着控制器必须执行完才重新观察。执行步数、重规划频率、图像延迟、推理时间和底层控制周期共同影响反应能力。离线比较预测与示范动作可以发现接口问题;真实闭环评估还应观察偏离示范后的恢复、碰撞/超限事件及人工介入。
十一、对接 GR00T:先选择训练入口,再确定数据适配
第一条路线是 NVIDIA Isaac-GR00T 参考仓库。当前说明使用带 GR00T 扩展的 LeRobot v2 布局,并提供 v3 转 v2 的辅助脚本。[10] 它要求额外的 meta/modality.json:通过 start/end 切片解释拼接的状态和动作数组,并映射视频与标注字段。[11] 因此,“已保存成 v3.0”不能直接作为该入口的训练兼容证明。
第二条路线是 LeRobot 原生的 groot policy。当前官方文档已经给出 GR00T N1.7 的训练与部署入口,并明确提示旧 N1.5 配置的兼容边界。[12] 使用这一入口时,应遵循所选 LeRobot 版本的数据加载器、预处理器与策略配置;不能把参考仓库的目录要求、命令参数和原生 policy 的配置随意拼接。
NVIDIA 的自定义本体指南还要求匹配 modality 配置、embodiment tag、观测字段与动作表示,并展示机械臂与夹爪可使用不同动作约定。[13] 这些配置具有物理含义:数组维度相同,不代表关节顺序、旋转表示、夹爪开合方向或相对参考一致。工程团队应先对少量片段完成读取、可视化与动作回放,再启动完整训练。
建议交付一份明确的兼容清单:数据格式版本、代码提交、模型检查点、转换脚本版本、相机键名、状态/动作语义、归一化统计与推理端控制接口。训练入口、模型版本或动作定义变化,都应触发小规模回归验证。转换成功与训练可用,应是两项独立结论。
十二、合成数据:扩大覆盖时保留物理与来源约束
Isaac Lab Mimic 的官方说明展示了从已标注子任务出发,变换并拼接示范片段,再通过任务成功条件筛选生成轨迹的流程。[14] 在适用任务中,这类方法可以扩展物体位置与场景配置,但其质量依赖源示范、物体参照、子任务边界和仿真环境。
GR00T-Dreams 是另一类数据生成蓝图。NVIDIA 的发布说明描述了利用 Cosmos 生成机器人任务视频,再提取动作表示用于学习的思路。[15] 世界模型生成、仿真轨迹扩增和实机遥操作应在数据来源中明确区分;生成画面具有视觉合理性,并不足以证明对应动作满足接触、摩擦和执行器约束。
我们建议保留源片段、随机种子、环境资产与生成配置,避免同一来源的衍生样本跨越训练/测试边界。合成数据的价值应通过真实留出任务上的增益衡量:在相同真实数据预算下,加入它是否减少失败与介入,是否在困难条件下有效。生成数量与仿真成功率可以作为过程指标,不能直接代替真实部署结论。
十三、构造示例:一条工业零件分拣数据链如何验收
以下是用于说明方法的构造场景,不代表壹典已经完成的机器人实验:一台机械臂将若干外形相近的零件按指令放入不同料盒。首先定义成功为“目标零件进入指定料盒且释放后保持稳定”,同时记录错件、落件、未释放和人工接管。具体判定窗口与几何容差由工艺要求确定,不预设通用数值。
采集阶段用第一人称设备记录操作过程与自然失败,用腕部/工位相机和机器人遥操作补充目标平台上的观测、状态、夹爪指令与反馈。对同一任务覆盖不同零件实例、遮挡、摆放、照明和操作者,并保留掉落后重抓等恢复过程。需要接触力约束时,再加入相应传感器,不能用视频标签替代实测。
加工阶段先验证时间映射与坐标链,再生成任务/事件标签和训练视图,保存为冻结的 LeRobotDataset v3.0 版本。按选定的 GR00T 入口生成适配产物,逐片段检查相机映射、动作单位与开合方向。评估时隔离完整操作会话、目标物体实例和选定工位,不把同一次示范的相邻帧随机分入不同集合。
放行时至少回答六个问题:关键事件是否可观测;时空误差是否落在本任务容忍范围;标签分歧是否处理;读写与转换是否保持语义;独立闭环任务是否达到约定目标;失败能否追溯回具体数据与配置。若只在已见物体上改善,应收窄结论,而不是把它写成通用操作能力。
十四、壹典的产业判断:数据壁垒来自可验证的复用
我们更看好能够把采集、标注、训练反馈和任务验收连续连接的数据能力。单纯扩大录像规模,会同步增加存储、清洗与复核负担;能够发现“哪些场景缺监督、哪些字段语义不一致、哪些失败需要补采”的系统,才更可能让下一轮数据投入形成可衡量收益。
评估成本时,可以同时观察每个合格 episode 的全流程成本,以及每个新增有效任务条件的覆盖成本。前者应计入设备摊销、工位重置、操作者、标注复核、转换与返工;后者用于防止大量近重复轨迹让单位片段成本变好,却没有拓展能力边界。训练收益应在固定测试方案下比较,并报告样本量与不确定性。
项目起步可采用三步:先用小批数据打通采集到回放,验证时间、空间与动作契约;再在冻结留出集上建立目标平台基线,按失败类型决定补采;最后扩大采集与自动标注,同时保留抽检和版本回退机制。若基础接口仍不稳定,优先修复链路比继续采购采集时长更有价值。
这也对应壹典在企业 AI 定制开发中强调的场景界定、样本验证和验收约定。具身智能项目的具体实施范围,需要结合硬件、控制系统与现场条件评估。本文提出的是基于公开技术资料的数据工程判断;形成可复用能力的依据,应是可回放的数据、可解释的失败和可重复的任务结果。
资料核验日期:2026 年 10 月 3 日。文中的硬件参数与软件接口均以所引官方资料及其对应版本为范围;构造示例与建议性验收方法由壹典整理,不作为任何厂商的统一性能承诺。
参考资料
- [1] Project Aria:Aria Gen 2 硬件规格 / Hardware Specification
- [2] Project Aria:Gen 2 采集配置与技术规格 / Technical Specifications
- [3] Chi et al.:Universal Manipulation Interface(RSS 2024)
- [4] Project Aria:多设备时间戳对齐 / Multi-Sequence Timestamp Alignment
- [5] Project Aria:Gen 2 设备标定 / Device Calibration
- [6] Hugging Face:LeRobotDataset v3.0
- [7] Hugging Face:Porting Large Datasets to LeRobot Dataset v3.0
- [8] Hugging Face:LeRobot 数据集路径与版本定义 / Dataset Utilities
- [9] NVIDIA:GR00T-N1.7-3B 模型卡 / Model Card
- [10] NVIDIA:Isaac-GR00T 官方仓库 / Reference Implementation
- [11] NVIDIA:GR00T 数据准备 / Data Preparation
- [12] Hugging Face:GR00T Policy
- [13] NVIDIA:Fine-tune on Custom Embodiments
- [14] NVIDIA Isaac Lab 2.3:Teleoperation and Imitation Learning with Isaac Lab Mimic
- [15] NVIDIA:GR00T-Dreams 与云到机器人开发平台(2025-05-18)
