具身智能数据建设中,最容易被低估的问题往往不是视频分辨率,而是“同一时刻”的定义。相机看见物体发生接触时,IMU、手部追踪和机器人日志是否记录了同一个物理事件?把录像切成统一的三秒或十秒,能否保留动作前因、接触瞬间与失败恢复?本文延续壹典此前的具身智能数据工程讨论,将问题进一步收敛到时间契约与训练样本设计。
先证明跨模态数据在时间与空间上可关联,再讨论切片长度。完整任务轨迹是可追溯的资产,事件片段和固定训练窗口是派生视图;合适的长度,应是在既定任务质量、因果性和部署响应要求下,经过验证的最小充分上下文。
- 01定义任务与时间契约
- 02采集与标定
- 03统一有效时间
- 04关联与质量掩码
- 05事件标注与训练视图
- 06消融与闭环验收
01一、先确定采集系统能观察什么,以及数据要训练什么
本报告讨论头戴、眼镜式或胸戴第一人称相机,以及与其配合的 IMU、手部追踪、腕部设备和机器人日志。目标场景是抓取、搬运、装配等操作任务,核心问题是多模态数据集如何构建,而不是某款设备的采购排名。引用的硬件事实来自官方资料;后文数值演算和切片建议是方法设计,不是壹典已完成的采集实验或模型成绩。资料核对日期为 2026 年 10 月 4 日。
纯 RGB 设备可以记录可见动作、物体变化与场景上下文,却通常不能直接给出可靠的绝对尺度、接触力或机器人关节动作。加入 IMU 后可以约束相机自身的旋转与运动,但头部 IMU 不等于手部运动传感器,也不能从头部加速度唯一恢复人手轨迹。手部姿态、深度与接触测量需要相应传感器或经过评估的视觉估计。
硬件指标必须落实到实际录制配置。Aria Gen 1 的 Profile 15 例如提供 30 fps RGB、30 fps SLAM,以及 1000 Hz 和 800 Hz 两路 IMU;其他 profile 的组合不同。标称最高采样率既不代表本次录制配置,也不证明无丢帧、无抖动或所有流具有同相采样。[4]
人体观察数据与机器人控制数据应分别定义监督语义。前者可以支持行为理解、表征学习、手物关系和运动目标推断;要成为机器人 action,还需明确重定向、可达性、关节限位、碰撞约束及控制接口。UMI 通过手持夹爪、相对轨迹和推理时延匹配研究这种迁移,说明采集接口与策略接口需要共同设计;其结果属于原论文作者,不能作为壹典能力或普通头戴视频的效果证明。[14]
- 采集前写明目标:离线步骤识别、在线动作预测、视觉惯性估计,还是机器人模仿学习。
- 记录实际分辨率、帧率、IMU 输出率、量程、滤波、固件、时钟域与标定版本。
- 将可直接测量、模型估计和未观测的变量分开标记,避免把推断值包装成传感器真值。
02二、统一时间轴:时钟一致、事件时刻一致与数据可用时刻是三件事
首先保留原始设备时间 t_device、时间域和单位,再转换到采集 session 的参考时钟。可采用统一工程模型 t_effective = a_s × t_device + b_s − d_s:a_s 表示时钟频率比例,b_s 表示时钟偏移,d_s 在本文中约定为“打戳事件晚于测量有效时刻”的延迟。它是分析模型,不是各厂商统一 API;具体符号、单位和补偿顺序必须与设备文档一致。
Aria Gen 1 同一副眼镜的传感器共享 DEVICE_TIME;HOST_TIME 是保存或到达时刻,不能替代捕获时刻。其硬件文档也区分相机曝光参考点与 IMU data-ready 打戳。共用时钟并不取消芯片内部处理延迟,接入时还要确认 SDK 或导出链路是否已经补偿,避免重复校正。[1][2][3]
独立设备需要估计偏移与频率差,而不仅在开始时对齐一次。本文构造例假设残余相对漂移为 20 ppm,则 1800 秒后可积累约 36 ms 偏差。若给漂移项分配 0.5 ms 预算,按 T ≤ ε/(p × 10⁻⁶) 计算,重新估计间隔约不超过 25 秒。这是简化恒定漂移模型的演算,不是设备规格,也不是通用校时周期。
硬件触发、共用时钟或支持 PTP 的采集系统,可以降低对软件到达时间的依赖,但需检查锁定状态、偏移分布及具体采集配置。PTP 对齐时钟值与频率,不自动保证自由运行相机的每次曝光同相;若要求同时采样,还需硬件触发或设备支持的计划采集机制。设备重启、时钟跳变和温度变化后,应重新分段拟合并保留残差。
第三个时间是 t_available,即在线决策真正拿到数据的时刻。某图像在 t_capture 捕获,经过传输、解码和追踪到 t_available 才能输入策略。离线重建可以使用双向插值;训练在线控制时,输入必须满足 t_available ≤ t_decision。未来样本可以作为监督目标,不能在没有声明的情况下进入历史观测。Kalibr 的时偏符号也应原样记录:其 timeshift_cam_imu 约定 t_imu = t_cam + shift,而不是笼统地“减掉延迟”。[5][6]
03三、曝光与滚动快门:用任务误差反推同步预算
帧周期、曝光时长与行读出时间应分别保存。30 fps 的名义帧周期约 33.3 ms,并不表示曝光持续 33.3 ms。Aria Gen 1 的 RGB 时间戳以中间行曝光中心为参考,官方给出逐行模型 t_row = t_image + (row/H − 0.5) × T_readout;其中 row 的方向和归一化应沿用该设备定义。相同模型不能直接套给时间戳含义不同的相机。
Aria Gen 1 官方资料给出的 RGB 行读出时间是:2880×2880 模式 16.26 ms,1408×1408 模式 5 ms。数值只适用于该代设备对应配置,不是 Gen 2 或所有 Ego 相机的标准。在快速转头和近距离手物交互中,整帧单一时间会掩盖像素行之间的观察时差。[2][3]
为估算时间误差的任务影响,可在近轴、局部运动条件下使用 ε_px ≈ f × (|ω| + |v_perp|/Z) × |δt|。f 是像素焦距,ω 是相关角速度,v_perp 是横向相对速度,Z 是深度。这是数量级近似;广角边缘、非刚体运动和复杂轨迹应使用具体投影模型与雅可比,不应把它称为普适精确上界。
构造计算例取 f=800 px、ω=2 rad/s、v_perp=0.5 m/s、Z=1 m,得到约 2000 px/s 的图像运动速度。1 ms 时间错位约贡献 2 px;若时间项只允许贡献 1 px,则预算约为 0.5 ms。理想 30 fps 自由运行视频用最近帧配对,时间残差可达约半帧,即 16.7 ms,对应约 33 px;800 Hz IMU 用最近点配对仍可能有 0.625 ms 残差。这说明“已经有时间戳”并不足以证明关联精度。
同一计算例中,4 ms 曝光区间内可能发生约 8 px 运动,形成模糊;它不能靠平移时间戳消除。系统预算宜分别列出时钟残差、时间戳语义、滤波延迟、采样关联与成像时间模型。未校正固定偏差不能用随机误差均方根相加来淡化;只有已校正、相互独立的随机项,才适合按方差叠加估计。增大切片长度也不会修复任何一项错位。
- 同步验收应报告残差 P50、P95、最大值、时段分布及异常比例,并说明测量事件与参考设备。
- 精度阈值由任务允许的像素、位姿或接触时间误差反推;本文的 0.5 ms 不是行业统一门槛。
- 曝光、图像裁剪、binning 或传感器滤波改变后,重新检查有效时间与内参,而不只修改 fps。
04四、硬件数据如何关联到视频帧:时间检索之后,还要处理坐标与信号语义
相机帧应关联到有效时间附近的原始传感器样本区间,而不是固定数量的数组位置。30 fps 与 800 Hz 平均每帧约对应 26.67 个 IMU 样本,实际数量随采样相位和丢包变化。需要积分的任务应检索相邻图像有效时刻之间的 IMU,并保留区间边界样本及积分假设,不能固定“每帧取 27 点”。
位置、姿态、加速度和接触状态对应不同算子。连续位置可在短而有效的区间内插值;姿态要在旋转空间插值,例如四元数 SLERP,避免直接插欧拉角。视觉惯性估计保留高频 IMU 做积分或预积分,并明确偏置、重力、轴向与单位。降低采样率前检查抗混叠和滤波群延迟。接触、按钮与模式切换是离散事件,应保留边沿或按任务采用前值保持,不生成不存在的中间状态。
空间约定可写为 T_AB 将 B 坐标变换到 A 坐标。刚性设备上相机位姿满足 T_WC(t)=T_WD(t)T_DC。静态世界点重投影为 u=π(T_CW(t_row)P_W);运动中的手或物体应使用同一有效时刻的 P_W(t_row),即 u=π(T_CW(t_row)P_W(t_row)),不能只校正相机时间。π 应使用真实针孔或鱼眼模型,目标与相机轨迹均需遵守有效时间和可用性约束。Kalibr 可以联合估计相机与 IMU 的空间、时间参数,但标定过程仍需要充分运动激励及可检查的残差。[5][6]
头戴相机与眼镜 IMU 可以具有固定外参;头戴相机与独立运动的人手、胸戴相机与腕部传感器则不能长期使用一个固定外参。后者需要共同世界参考下的动态位姿,或显式估计的人体运动链。关联表还应携带追踪置信度、时间残差、样本年龄、饱和和遮挡标记。丢帧、重定位或跟踪失效区间应标为无效或单独处理,不跨长缺口强行插值。
- 连续状态视图、IMU 积分视图与接触事件视图可以共用原始档案,但不应共用一个粗暴的重采样规则。
- 在线观测采用可用时刻约束;离线双向插值结果必须标明,不默认用于在线策略输入。
- 硬件信号只能辅助提出事件候选;头部加速度峰值本身不能证明发生了手物接触。
05五、构建可追溯关联层:原始数据、有效时间和媒体时间分别保存
建议把数据组织为三层:不可覆盖的原始采集档案、经过标定与同步的关联层,以及可重建的训练视图。视频保存设备捕获时间、原始帧标识、PTS 和 time_base;传感器保存其原始时间域、样本序列与配置。关联层记录每个派生样本取用了哪些原始字节、时间映射和标定。切片只是索引视图,不应替换完整连续记录。
MP4 的 PTS 是媒体呈现时间,不天然等于设备捕获时间。变帧率、丢帧、转码、补帧或裁剪后的时间归零,都会使简单的 frame_index/fps 失去原始时间意义。FFmpeg 的帧率模式可以丢弃或重复帧,时间戳选项也会影响输出时间轴;因此应显式保留“输出帧→原始帧→有效采集时刻”的映射,并对实际解码后的边界做抽查。[15]
Ego-Exo4D 的 timesync.csv 记录各相机 PTS 和帧号对应,take 元数据再引用采集记录中的同步边界。这提供了一个有用范例:先建立完整采集的跨视角关联,再按活动裁剪,而非在裁剪后凭文件名或第一帧强行对齐。[8]
时间和参数都有版本。建议原始纳秒计数使用整数或可无损表示的字段,避免将绝对 epoch 纳秒直接塞进不具备相应整数精度的数值容器。标定版本应包含镜头模型、内外参、时偏及符号、IMU 单位与轴向;动态参数如曝光和增益按帧记录。每次重新校时、裁剪或重采样都产生新清单,而不是覆盖唯一源文件。
- 身份:participant_uid、capture_uid、episode_uid、设备和原始文件哈希。
- 时序:原始时间域、t_device、t_effective、t_available、PTS/time_base、时钟映射版本。
- 关联:raw_frame_id、raw_sample_range、标定版本、重采样规则及有效性 mask。
- 事件:动作边界、边界不确定区间、证据来源、失败/恢复类型与标注版本。
- 以上字段为本报告建议的追溯契约,不是某数据格式全部强制字段。
06六、把“切片长度”拆开:episode、事件段、观察窗和动作时域
Episode 是一次连续任务尝试,要保留初始状态、过程、结果以及失败恢复;事件段则围绕接近、接触、抓取、搬运、放置或撤离等边界,时长可变。观察上下文 C_obs 是模型在决策时刻能访问的历史。固定训练窗口长度 L 与相邻窗口步长 S 分别决定覆盖范围和重叠程度;它们不是同一个参数。
动作预测步数 H 表示一次输出多少步;执行步数 E 表示重新观察或规划前真正执行多少步,通常 E≤H。若统一训练网格为 f_grid,H 个等长控制 tick 的覆盖约为 H/f_grid;若讨论索引 0…H−1 的首末采样跨度,则是 (H−1)/f_grid。这两种端点约定都可使用,但必须写清。
构造例中,H=16、f_grid=50 Hz,对应约 0.32 秒控制覆盖和 0.30 秒首末跨度;若执行 E=4,名义执行周期为 0.08 秒。实际能否按此周期重新规划,还取决于推理、通信和调度时延。将同一 16 步配置换到 10 Hz,会变成约 1.6 秒覆盖。底层电机伺服 1000 Hz 不意味着学习策略也在 1000 Hz 的网格上预测。视频观察窗更不能直接等同于这些动作秒数。
Diffusion Policy 原论文区分观察、预测和执行时域,并讨论动作一致性与反应速度的权衡;这是采用独立变量分析的依据,不是“最佳八秒”的证据。GR00T 的 delta_indices 也是相对当前行的时间索引,实际 horizon 应读目标 checkpoint 与 embodiment 配置。仓库中的 16 步示例不是对所有 GR00T 版本或所有任务的最优建议。[12][13][16]
最后还有存储分片长度。为了减少小文件而把多个 episode 放入共享 MP4,与模型一次看几秒完全不同。高频硬件影响可解析的事件细节,模型观察采样率影响输入信息和算力,任务因果关系决定需要多长上下文。由任何一个单独频率反推“最佳切片秒数”都缺少依据。
07七、哪种时间切片最合适:事件边界为主,固定窗口作为可验证基线
对于本报告关注的抓放与装配类 Ego 数据,建议先完整保留 episode,再以动作或状态事件作为标注主单位。离线步骤理解的起始方案是事件区间加前后各 1 秒上下文;若边界不确定,就扩大上下文并记录不确定区间。这是便于开展首轮实验的工程建议,不是已证明普遍最优的长度。
还没有可靠事件标注时,可以先用 8 秒固定窗、4 秒步长建立步骤理解基线,并在同一数据划分上比较 2、4、8、16 秒。8 秒只承担可复现的起点角色:长度上可容纳后文 5.7 秒事件视图,但实际完整覆盖还取决于窗口起点。例如 [8,16) 与 [12,20) 都会截断 [11.4,17.1),因此必须保留独立事件视图,并对关键过程做事件对齐或完整覆盖检查。更短接触瞬间和更长多步骤任务需要另设尺度;该起点不是从硬件规格或模型默认值推出来的。
如果目标是快速接触、视觉惯性运动或在线反应,应单独研究局部时间范围和足够高的采样频率。首轮观察上下文可比较 0.5、1、2、4 秒,而接触边沿仍保留原始高频流与精细标签。低帧率造成的漏观测不能通过把片段延长到十秒解决。若目标是失败归因、恢复策略或步骤依赖,保留完整 episode,并从更长过程按需取上下文。
事件边界也不能只依据语音。EPIC-KITCHENS 把 narration_timestamp 与动作 start/stop 分开,体现叙述时刻和动作区间具有不同语义。首次接触宜由视觉、夹爪或力信号共同核对;抓取成功需要物体随操作持续移动等结果证据,而不只是手指或夹爪闭合。失败、误触与重抓应保留并分类,不能全部混作成功模仿轨迹。[17]
因此,对“最合适”的回答应具体到任务:标注主片段优先由事件决定;固定窗先用候选网格做比较;在线策略另行确定因果观察、预测和执行时域。最终选择满足预先约定质量与响应要求、资源成本较低的最小充分上下文。没有任务定义和消融结果时,应称它为候选方案,而不宣布一个统一最佳秒数。
- 离线事件/步骤理解:事件区间+前后各 1 秒作为起始方案,允许按边界和因果覆盖调整。
- 无事件边界的步骤理解:8 秒窗、4 秒步长作基线,与 2/4/16 秒候选比较。
- 在线控制:仅使用决策时刻可得到的历史,前述“后 1 秒”不能作为输入。
- 长程任务与失败恢复:完整 episode 必须保留,不能由短片段拼凑出缺失的因果过程。
08八、贯穿示例:一次抓放动作如何产生多个正确的训练视图
以下为构造演算,没有实际采集、标注或训练结果。假设采集系统实际记录 RGB 30 fps、IMU 800 Hz、手部追踪 60 Hz,完整抓放尝试持续 24 秒。参考时钟上,某目标动作从 12.4 秒到 16.1 秒,时长 3.7 秒;此前有接近动作,之后需要确认放置稳定。所有流已完成各自时钟和测量延迟校正。
离线事件视图取 [11.4,17.1) 秒,保留前后各 1 秒,长度 5.7 秒。在理想均匀且无缺失的假设下,名义数据量约为 171 帧 RGB、4560 个 IMU 样本和 342 个手部追踪样本;实际数量由有效时间戳检索得到,不用这些乘法反推固定行号。同步、插值和降采样所需的边界支持样本也必须记录,即使它们位于该可见区间之外。
动作起点 12.4 秒是标签边界,而非录像文件起点。切片时间统一转成 episode 相对时间和媒体时间映射,区间采用左闭右开以避免重复归属。第一次接触若有 ±50 ms 标注不确定区间,应保存该区间;不要因为 IMU 采样间隔 1.25 ms 就把人工视觉边界宣称为毫秒精度。
步骤理解视图可以从这段范围取较低频的代表帧,但必须确认关键接触与结果没有被抽样跳过。若模型因果观察采用 4 秒历史、8 Hz 采样,32 个采样位置覆盖的是一个 4 秒网格区间,其首末中心跨度为 31/8=3.875 秒。该网格和原始 30 fps 录像需要明确配对残差及样本年龄,不能把模型抽样后的 8 Hz 冒充采集帧率。
机器人控制视图只有在机器人 state/action 监督真实可得时才建立;否则这套数据仍是人体观察或推断轨迹。假设另有正确关联的 50 Hz 机器人网格,动作 H=16、执行 E=4 可形成约 0.32 秒预测覆盖和 0.08 秒执行覆盖。缺少机器人动作时,不能通过补零、复制手部关键点或填充字符串来制造可执行标签。50 Hz 控制网格也不会把原始 30 fps 视频变成每秒 50 次独立视觉观测。同一原始帧可能供多行使用,应保存原始帧标识、实际捕获时间和观测年龄,并遵守在线可用时间的配对规则。
一个 5.7 秒标注片段因此可能派生出多种模型样本,而原始 24 秒 episode 仍承担结果和恢复的证据。三层数据分别服务于可追溯采集、可复核语义与特定模型训练;让它们共享相同 episode 身份,比要求所有文件都恰好长五秒更重要。
09九、导出 LeRobotDataset v3.0:媒体偏移不是硬件时间校准
LeRobotDataset v3.0 将多个 episode 合入较大的 Parquet 和每相机 MP4,通过元数据还原 episode。其高效文件布局适合训练读取,但不会自动完成原始设备校时。本文以官方说明和 LeRobot v0.6.1 源码为字段复核基线;实际交付应冻结自己的软件、数据 schema 和 reader 版本,避免把不同版本的目录约定混用。[9][10]
帧行中的 timestamp、frame_index、episode_index、全局 index 和 task_index 描述训练数据索引;meta/info.json 的 fps 则定义查询网格。episode 元数据使用 dataset_from_index/dataset_to_index 定位数据行,以及每相机视频文件与 from_timestamp/to_timestamp 定位媒体区间。这些字段不替代原始设备时间、时钟映射和曝光记录。
v0.6.1 reader 的视频查询采用 query_media_time = videos/<key>/from_timestamp + row.timestamp。因此 from_timestamp 是某 episode 在共享 MP4 内的媒体偏移,不是传感器绝对时间,也不是测出的跨设备 offset。正确流程是先得到对齐训练行,再保存其与共享媒体的关系;原始校准证据由侧表或原始档案保留。[10]
delta_timestamps 表示相对当前行的秒数偏移,工具按 fps 检查网格相容性并转换为行偏移。它不是任意异步传感器匹配器。v0.6.1 reader 将越界索引夹到当前 episode 的首/末行,并返回对应 <key>_is_pad 标记;该标记不表示训练器已自动排除损失。训练需要定义 padding 权重或排除规则,不能把重复端点看成真实静止动作,更不能跨相邻 episode 拼出上下文。[10][19]
建议保留 training_row → raw_frame_id/raw_sample_range/clock_model_version/calibration_version/resampling_recipe/validity_mask 的追溯侧表。这些是本报告的设计字段,不是 LeRobot 官方强制 schema。改变切片、网格或校准后,由同一原始档案重新生成视图,同时更新特征统计。reader 的读取容差用于数据读取检查,不能当作硬件同步精度的验收证明。
10十、进入 GR00T:消费格式、动作语义与时间配置要共同验收
截至资料核对日,NVIDIA Isaac-GR00T 参考仓库的数据准备文档使用 GR00T-flavored LeRobot v2,并要求 v3 数据通过提供的脚本转换;Hugging Face LeRobot 自身则提供另一条 GR00T policy 集成入口。这里的限制针对具体实现路径,不能泛称所有 GR00T 都不支持 v3,也不能看到 LeRobot 字样就推定任何 v3 数据可以直接训练。[11][18]
消费者配置还要核对视频键、state/action 数组切分、语言字段、embodiment 与动作表示。末端目标位姿、关节目标、相对增量和力控制参数不是可互换标签。坐标系、单位、旋转表示和控制周期要随配置明确保存;若 processor 会从绝对值构造相对动作,就不能在导出时再重复做差。
GR00T 的 delta_indices 决定每个模态相对当前行取哪些步,观察与动作可以有不同范围。改变动作 horizon 后,应按对应实现重新生成统计信息,特别是包含逐步时间维度的 relative_stats。预测 horizon 与实际执行步数也必须分别核验,不能把配置示例的 16 步当作最佳视频切片。[12][13]
人类手姿到机器人动作的映射,最终应通过机器人可达性、轨迹平滑性、碰撞和闭环任务检查。UMI 的接口设计和时延匹配提供了研究参考,但不取消本体差异与部署验证。数据验收至少应区分人体观察、推断轨迹、经重定向验证的机器人动作三个层次,使模型训练人员知道每个标签支持什么结论。[14]
11十一、切片长度如何验证:把时间、采样、horizon 与算力分开消融
先按 participant、capture、episode 及目标泛化场景建立分组划分,再生成窗口。高度重叠的相邻片段不能随机分到训练和测试集;历史观测、未来监督、插值边界和 padding 都属于样本实际访问的时间支持范围,也应检查隔离。壹典此前的训练数据集验收讨论涉及去重、评估独立与版本追溯,这些要求在视频与传感器场景同样需要落实。
第一组实验固定原始 episode、模型和动作 horizon,只改变观察窗口;第二组固定窗口秒数,改变实际视觉采样率与输入帧数。执行 E 的消融固定 H 和 checkpoint,仅改变推理时执行步数;预测 H 的比较则需分别训练或适配对应输出配置,更新逐步统计,并保持 E、数据与预算规则一致。不能同时增大上下文、帧数和动作时域,然后把所有收益归因于“更长切片”。
候选步骤理解窗口可取 2/4/8/16 秒,局部因果观察可取 0.5/1/2/4 秒,均是示例搜索网格。统计动作持续时间分布和关键事件间隔后,可以调整候选。若视觉编码每帧产生 256 token,则 32 帧已约 8192 个视觉 token;帧数翻倍会改变资源成本,采用密集全局注意力的部分还可能按 token 数平方增长。实际结构、压缩和批处理需实测,不能直接按这项估算宣称吞吐。
同时报告离线边界误差、事件 F1、动作误差,以及适用任务的闭环成功率、接触/插入失败、扰动恢复、响应延迟 P50/P95、吞吐与峰值显存。以 episode 或 capture 为统计单位进行重复试验和置信区间估计,重叠窗不增加同等数量的独立证据。人体观察数据集无法直接给出机器人闭环成功率,此项需要另行实际执行。
可另做时间偏差敏感性实验:在冻结数据副本中注入 ±10/±30/±60 ms,比较快速接触与慢速步骤受影响程度。这些数值只是探测点,不是合格阈值。验证集用于选择满足预设质量下限且成本合理的最小上下文,测试集在冻结方案后使用;实验还应报告训练更新数、随机种子、总输入帧或 token、GPU 时间及预训练数据重叠限制。
- 时间关联:校时残差、有效时刻语义、曝光/读出模型与实际配对误差。
- 信号质量:丢失、饱和、追踪失败和最大间隙,分任务报告排除原因。
- 语义质量:边界一致性、结果证据、失败/恢复覆盖与人工不确定度。
- 复现质量:原始文件、标定、标签、划分、重采样、统计和训练配置的版本链。
12十二、交付建议:把最小充分上下文变成可重建的数据契约
本报告建议的优先顺序是:定义任务可观察信息与因果边界,验证时钟和成像误差预算,完成空间与信号关联,再建立事件标签与多尺度训练视图。切片长度放在这一链路中选择,才能解释某个配置为什么适用,而不是靠统一秒数掩盖关联错误。
对抓放和装配类首轮数据建设,可采用“完整 episode 不裁掉、事件区间加前后各 1 秒用于离线标注、8 秒固定窗作为步骤理解基线、在线控制另设因果历史和动作时域”的组合。随后用独立消融选择长度;不符合该场景或不满足预算的任务,应改变采集、标注或训练契约,而不是机械沿用数字。
最终交付应能从训练样本追溯到原始帧和传感器区间,解释每次同步、插值、裁剪与标签判断,并恢复相同版本。官方数据格式和公开模型为交换、训练提供基础,实际专业性体现在信息是否可信、时间是否可核对、动作语义是否成立,以及任务结论是否经过与其用途相称的验证。
参考资料
- [1]Aria Gen 1: Timestamps in Aria VRS Files
Meta Project Aria
- [2]Aria Gen 1: How Data From Project Aria Devices is Timestamped
Meta Project Aria
- [3]Aria Gen 1: Temporal Alignment of Aria Sensor Data
Meta Project Aria
- [4]Aria Gen 1: Project Aria Recording Profiles
Meta Project Aria
- [5]Kalibr: Camera–IMU Calibration
ETH Zürich Autonomous Systems Lab / Kalibr contributors
- [6]Kalibr: YAML Formats
ETH Zürich Autonomous Systems Lab / Kalibr contributors
- [7]Precision Time Protocol
Basler AG
- [8]Ego-Exo4D: Takes and Timesync Metadata
Ego-Exo4D project
- [9]LeRobotDataset v3.0
Hugging Face LeRobot contributors
- [10]LeRobot v0.6.1: Dataset Reader
Hugging Face LeRobot contributors
- [11]Isaac-GR00T: Robot Data Preparation Guide
NVIDIA Isaac-GR00T contributors
- [12]Isaac-GR00T: How to Prepare Your Modality Configuration
NVIDIA Isaac-GR00T contributors
- [13]Isaac-GR00T: Policy Interface
NVIDIA Isaac-GR00T contributors
- [14]Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots
Cheng Chi, Zhenjia Xu, Chuer Pan, Eric Cousineau, Benjamin Burchfiel, Siyuan Feng, Russ Tedrake, Shuran Song
- [15]FFmpeg Documentation: Timestamp and Frame-Rate Options
FFmpeg developers
- [16]Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
Cheng Chi, Zhenjia Xu, Siyuan Feng, Eric Cousineau, Yilun Du, Benjamin Burchfiel, Russ Tedrake, Shuran Song
- [17]EPIC-KITCHENS-100 Official Annotations
EPIC-KITCHENS project
- [18]LeRobot: GR00T Policy
Hugging Face LeRobot contributors
- [19]LeRobot v0.6.1: Temporal Feature Utilities
Hugging Face LeRobot contributors
文中引用的公开研究与工程成果归原作者所有。本文的整理、分析与观点不代表原作者立场,也不构成壹典的产品性能承诺。
