技术指南 · 每条论断都对应论文或 README

架构:一个潜在骨干,两个指令面

MotionBricks 是一个模块化潜在生成骨干——VQVAE 动作分词器、pose 模型和 root 模型——通过智能图元暴露能力:移动用速度、朝向与风格指令,物体交互用代理关键帧。本页把这些组件对应到安装后你会看到的文件。

模块化潜在骨干

不是单个巨型网络,发布版训练了三个组件,权重在 out/ 里——训练脚本与组件一一对应(见训练指南):

1 · VQVAE 动作分词器

把动作压缩为离散潜在编码。另外两个组件都在这个潜在空间里工作,scripts/train_vqvae.py 最先训练它——pose 模型需要它的 checkpoint。

2 · Pose 模型

在分词器的潜在空间里生成动作的身体位姿侧,由智能图元指令驱动。Checkpoint 目录:out/motionbricks_pose/

3 · Root 模型

生成根轨迹——身体去哪、多快。按 README 注释,它训练时不需要 VQVAE,所以 root 与 pose 把任务干净地拆开。Checkpoint 目录:out/motionbricks_root/

单个骨干覆盖整个语料的回报是项目页上的数字:一个模型覆盖 350,000+ 动作片段,15,000 FPS,2 ms 延迟——而不是一堆按技能拆开的系统库。

完整 LFS 拉取后 out/ 里的内容(按 README,合计约 2.2 GB):
Checkpoint 文件大小
out/G1-clip.ckpt~7.5 MB
out/motionbricks_vqvae/version_1/checkpoints/*.ckpt~273 MB
out/motionbricks_pose/version_1/checkpoints/*.ckpt~1.6 GB
out/motionbricks_root/version_1/checkpoints/*.ckpt~391 MB

如实说明范围:README 点名了三个模型组件和文件布局,但没有说明 out/G1-clip.ckpt 除随发布一起提供之外的用途;内部机制以论文的方法章节为准。本页不声称任何官方材料没写的东西。

智能图元:指令面

骨干是大规模的;接口是小的。两个图元家族覆盖导航与交互,项目页描述为"用于创作导航与物体交互的统一、稳健、直观接口":

智能移动——速度 + 朝向 + 风格

你指挥三件事:多快、哪个方向、什么风格。项目页:该图元"从任意速度、朝向与风格指令合成自然动作,无需重新训练或按任务调参"。演示里的 11 个风格键全是这个接口——见风格库

智能物体——代理关键帧

场景交互被指定为"一组灵活的代理关键帧;骨干网络补全接近、接触与跟随动作——每次运行都有自然变化"(项目页)。README 图库展示了拾取、摔倒、跳长凳与坐下。

G1 风格人形俯身、抓住剑道具并持剑站起——MotionBricks 生成的智能物体拾取动作
智能物体在动作中:代理关键帧进,完整的接近-接触-跟随动作出。官方 GIF,由 NVIDIA 托管。

Zero-shot:新任务无需重训

论文的可扩展性主张在项目页上写得很直白:"MotionBricks 以 zero-shot 方式应用于新的下游任务——无需微调或任务专属标注——因此应用可以像搭积木一样即插即用地组装,无需动画专家知识。"一组新指令组合不是一次新训练;同一个骨干就能回答它。这就是"像积木一样组装动作"在实践中的含义。

动画管线里消失的东西

官方 2:40 无剪辑 UE5 演示是证据,项目页逐字给出了配方:"每个动作都由神经网络生成——没有脚部锁定、没有混合、没有碰撞检测、没有手写过渡。"其中每一项都是一整类传统动画图工作:

这在 Unreal 工作流里意味着什么,见UE5 集成页;这个设计的机器人侧邻居是GEAR-SONIC

训练数据从哪来

语料是 BONES-SEED 数据集,README 描述为"来自真实人类演员的 35 万个生产级动作捕捉片段"(Hugging Face 数据集页)。"350,000 片段 vs 15,000 FPS"这个说法按来源的拆解——包括 142,220 条重定向 G1 轨迹与约 288 小时——在官方素材页展开。

机器人可用的轨迹由 SOMA Retargeter 产生,"把 SOMA 捕捉重定向到 G1 的 Newton 求解器"(README)——见 NVIDIA/soma-retargeter。SOMA 捕捉变成 G1 MuJoCo 轨迹,骨干学的就是这些;动作特征格式本身记录在官方 motion representation 文档里。

Unitree G1 人形执行 MotionBricks 生成的全身动作——官方机器人学预告
官方 README 图库的机器人学预告——动作是实时生成的,不是回放。

下一步

训练指南

三条训练命令逐字照录、合成数据默认值、真实数据集下载与自定义数据文档。

风格库

全部 11 个风格键位,每个风格族配官方 GIF,以及诚实的限制说明。

安装指南

用 Git LFS 克隆、拉取约 2.2 GB 权重、避开 1 KB 指针陷阱。

官方素材

每个数据集、checkpoint 与文档的源链接,以及数字勘误说明。