数据指南 · 训练语料

BONES-SEED:35 万段剪辑在哪

每篇 MotionBricks 讲解都引用“超过 35 万段动作剪辑”,然后戛然而止。本帖跟着证据链走:README 指向哪个页面、数据集自己说自己装了什么、发布的训练脚本在有无该数据时分别怎么跑。

三个页面,三种角色

BONES-SEED 数据集宣传图,出自 MotionBricks README Related Work 一节
BONES-SEED 宣传图——托管在 NVIDIA 仓库,只链接不镜像。
两个数字都真实、都出自官方页面;它们描述的是不同的计数。“350k”是 README 对动捕语料的概括;142,220 段、约 288 小时是 Hugging Face 卡片的盘点。别把它们平均成一个数。

它如何喂给训练——以及跳过它会怎样

数据变成 MotionBricks 形状之前还有一步:SOMA Retargeter 是基于 Newton 的求解器,把 SOMA 动捕转换到 G1 骨架上,产出机器人可用的轨迹。

然后,按 README 原意:发布的训练脚本(train_vqvae.pytrain_pose.pytrain_root.py默认使用合成数据,这是故意的——让你不下载真实语料也能端到端验证整条管线。真实数据集是用来复现预训练权重的,不是让代码跑起来的。

看完安装指南后的实际顺序:先跑一遍合成训练证明环境可用;等真的在意复现权重时,再从上面的页面拉 BONES-SEED;任何商业计划之前,先读数据集自己页面上的许可条款——本站不会转述你一分钟就能读完的内容。

为什么语料对架构叙事重要

可扩展性主张——一个潜在骨干覆盖 35 万段以上剪辑,而不是一堆模型——之所以有趣,正是因为数据够宽:行走、爬行、受伤步态、物体接触。README 里的 GIF 图库(风格页上能看到几张)其实就是这种广度的抽样。有人问“35 万对动捕来说算大数吗”,更有用的回答是它相对什么算大:先前的单模型动作工作训练语料要小得多,这一点论文在相关工作章节有讨论。