数据与模型
加载中参考特征与数据集、checkpoint 和预处理绑定。
计算数据集参考分布
遍历所选数据集的全部 episode。抽帧数量和覆盖率会随结果保存;先用抽帧参考探索,再按需要计算每一帧。全帧计算需要更长时间和更多存储。
载入 episode 后可以直接查看图像和记录状态。
Episode
frame —实际输入
尚未载入任务文本。
图像由所选 checkpoint 的 processor 处理。回放使用本 episode 的任务文本。
记录状态作为每帧输入;整段推理完成后可以拖动查看缓存结果。
GR00T N1.6
点选模块展开分析完整推理模型 · 从观测到动作
INPUTS 一帧观测与任务条件
RGB IMAGES多视角图像Head / Right wrist
LANGUAGE自然语言指令当前 episode 的任务文本
PROPRIOCEPTION机器人状态关节与手部状态
ACTION NOISE高斯噪声x₀ ∼ N(0, I)
EAGLE 视觉语言骨干 · VLM Backbone
LANGUAGE ENCODING文本编码Tokenizer · Token Embedding
STATE PROCESSOR状态预处理归一化与维度填充
INITIAL ACTION初始动作块 x₀从噪声开始迭代
ACTION HEAD 流匹配动作生成头 · Flow-Matching
VL CONDITION视觉语言条件特征归一化 → DiT 条件
ACTION ENCODER动作与时间编码当前动作 xₜ + 时间步 t
FLOW-MATCHING TRANSFORMERDiT · 动作生成核心
视觉语言条件状态 + 动作 tokens时间步调制
ACTION DECODER动作解码形态条件 MLP → 预测流速 vₜ
FLOW INTEGRATION迭代更新动作xₜ₊Δₜ = xₜ + Δt · vₜ
每次迭代更新动作,复用同一帧的视觉语言与状态条件。
OUTPUT 反归一化 · 取有效动作步与维度
带 + 的模块可展开分布分析;一次只展开一个,再次点击即可收起。
当前帧的记录状态
完整动作块 · 预测与标签
尚未推理蓝色:预测;橙色:训练标签;灰色虚线:当前状态。横轴为未来动作步。末尾缺少标签的步不参与误差。
各动作维度与全 chunk 误差
当前输出的参考分布
整段变化 · COS 曲线
点击曲线跳转到对应帧
当前值与 Q01–Q99
相似的采集记录
同任务 · 每段最多一个。点击样本核验两路原始画面。
参考样本
图上远近用于探索;COS 和参考分位不直接代表异常概率或抓取成功率。
每帧从记录的图像和状态独立推理;预测动作不会反馈到下一帧输入。关节预测与 EEF 空间误差需要分别分析。