指南 · 命令逐字来自官方 README

训练 MotionBricks:三条脚本,一条今天就能验证的管线

预览版发布了全部三个模型组件的训练代码——VQVAE 分词器、pose 模型与 root 模型——默认用合成数据,让你在碰真实数据集之前就能端到端跑通整个流程。下方命令原样抄自 README;我们没有改写或重测。

先完成安装——训练指南假设环境可用

三条训练命令

在克隆的 motionbricks/ 目录里运行。README 注明脚本"默认使用合成数据,并从 out/ 中保存的 checkpoint 加载模型配置":

# Train the VQVAE (motion tokenizer)
python scripts/train_vqvae.py

# Train the pose model (requires pretrained VQVAE checkpoint)
python scripts/train_pose.py

# Train the root model (no VQVAE needed)
python scripts/train_root.py

顺序只有一次重要:pose 脚本需要 VQVAE checkpoint(out/ 里的预训练版,或你自己刚训练出来的),root 模型则独立训练——README 注释白纸黑字写着。每个脚本对应哪个组件,见架构页

合成数据:先验证管线

当前所有训练脚本都默认合成数据(见 motionbricks/data/synthetic_dataset.py),"以便在不需要真实数据集的情况下端到端验证完整训练管线"(README)。实际含义:

真实数据集

README 声明预训练 checkpoint 所用的数据集可在 bones.studio/datasets 下载——完整动作数据集都在那里。发布模型背后的训练语料是 BONES-SEED(细节与数字注意事项见素材页)。

在投入带宽之前想先看个轻量参考:四个文件合计约 2.2 GB 的 checkpoint 大小列在安装指南里。

自己的数据或新机器人

仓库里有两份官方文档回答本指南刻意不编造答案的定制问题:

Motion representation 文档

"动作特征表示、骨架系统、坐标约定、归一化与特征计算管线的细节"(README 对 docs/motion_representation.md 的描述)。

添加你自己的数据集

"用自己的动作数据训练 MotionBricks 并适配新机器人的分步指南"(README 对 docs/adding_your_own_dataset.md 的描述)。

完整发布状态——路线图实际说了什么

剩下的拼图是与机器人学整合的完整管线。逐字引用 README 的路线图条目:

"Full training pipeline inside GR00T Whole-Body Control's GEAR-SONIC pipeline — targeted for approximately one month out; reproducibility experiments are already in flight."

本指南坚持两点澄清:"约一个月后"是从 2026-04-27 预览公告算起的,而且它是官方路线图的估计,不是发布承诺——别处引用的任何具体日期都当猜测处理。真实进度看新闻页官方仓库;训练管线在哪接入 SONIC 部署,见GR00T-SONIC 页