DDMP · 模型回放

沿着一段采集记录,查看模型从输入到动作的变化。

数据与模型

加载中
参考特征与数据集、checkpoint 和预处理绑定。
计算数据集参考分布

遍历所选数据集的全部 episode。抽帧数量和覆盖率会随结果保存;先用抽帧参考探索,再按需要计算每一帧。全帧计算需要更长时间和更多存储。

载入 episode 后可以直接查看图像和记录状态。

Episode

frame —
当前帧 Head RGB
Head RGB · 原始输入
当前帧 Right wrist RGB
Right wrist RGB · 原始输入

实际输入

尚未载入任务文本。

图像由所选 checkpoint 的 processor 处理。回放使用本 episode 的任务文本。

记录状态作为每帧输入;整段推理完成后可以拖动查看缓存结果。

GR00T N1.6

完整推理模型 · 从观测到动作

点选模块展开分析
INPUTS 一帧观测与任务条件
RGB IMAGES多视角图像Head / Right wrist
LANGUAGE自然语言指令当前 episode 的任务文本
PROPRIOCEPTION机器人状态关节与手部状态
ACTION NOISE高斯噪声x₀ ∼ N(0, I)
EAGLE 视觉语言骨干 · VLM Backbone
LANGUAGE ENCODING文本编码Tokenizer · Token Embedding
STATE PROCESSOR状态预处理归一化与维度填充
INITIAL ACTION初始动作块 x₀从噪声开始迭代
ACTION HEAD 流匹配动作生成头 · Flow-Matching
VL CONDITION视觉语言条件特征归一化 → DiT 条件
ACTION ENCODER动作与时间编码当前动作 xₜ + 时间步 t
动作嵌入时间嵌入
FLOW-MATCHING TRANSFORMERDiT · 动作生成核心
视觉语言条件状态 + 动作 tokens时间步调制
ACTION DECODER动作解码形态条件 MLP → 预测流速 vₜ
FLOW INTEGRATION迭代更新动作xₜ₊Δₜ = xₜ + Δt · vₜ

每次迭代更新动作,复用同一帧的视觉语言与状态条件。

OUTPUT 反归一化 · 取有效动作步与维度

带 + 的模块可展开分布分析;一次只展开一个,再次点击即可收起。

每帧从记录的图像和状态独立推理;预测动作不会反馈到下一帧输入。关节预测与 EEF 空间误差需要分别分析。