数据指南 · 训练语料
BONES-SEED:35 万段剪辑在哪
每篇 MotionBricks 讲解都引用“超过 35 万段动作剪辑”,然后戛然而止。本帖跟着证据链走:README 指向哪个页面、数据集自己说自己装了什么、发布的训练脚本在有无该数据时分别怎么跑。
三个页面,三种角色
- README 的指针。MotionBricks README 把下载动作数据集的地址指向 bones.studio/datasets——Training 一节和 Dataset 一节各出现一次。Related Work 把语料描述为“350k production-grade mocap clips from real human actors and actresses”(35 万段来自真人演员的职业级动捕剪辑)。
- 数据集页。Hugging Face 上的 BONES-SEED 卡片才是语料细节所在:官方页计数为 142,220 段剪辑、约 288 小时——更大动捕集合里重定向到 G1 的那部分轨迹。每个子集装了什么,以卡片原文为准。
- 本站的事实页。首页把 35 万这个数字链回它来自的项目页原句,辟谣帖则拆清哪个数字指什么。
两个数字都真实、都出自官方页面;它们描述的是不同的计数。“350k”是 README 对动捕语料的概括;142,220 段、约 288 小时是 Hugging Face 卡片的盘点。别把它们平均成一个数。
它如何喂给训练——以及跳过它会怎样
数据变成 MotionBricks 形状之前还有一步:SOMA Retargeter 是基于 Newton 的求解器,把 SOMA 动捕转换到 G1 骨架上,产出机器人可用的轨迹。
然后,按 README 原意:发布的训练脚本(train_vqvae.py、train_pose.py、train_root.py)默认使用合成数据,这是故意的——让你不下载真实语料也能端到端验证整条管线。真实数据集是用来复现预训练权重的,不是让代码跑起来的。
看完安装指南后的实际顺序:先跑一遍合成训练证明环境可用;等真的在意复现权重时,再从上面的页面拉 BONES-SEED;任何商业计划之前,先读数据集自己页面上的许可条款——本站不会转述你一分钟就能读完的内容。
为什么语料对架构叙事重要
可扩展性主张——一个潜在骨干覆盖 35 万段以上剪辑,而不是一堆模型——之所以有趣,正是因为数据够宽:行走、爬行、受伤步态、物体接触。README 里的 GIF 图库(风格页上能看到几张)其实就是这种广度的抽样。有人问“35 万对动捕来说算大数吗”,更有用的回答是它相对什么算大:先前的单模型动作工作训练语料要小得多,这一点论文在相关工作章节有讨论。