Wh0:把生成式世界模型当作可扩展的 egocentric 人手操作数据源
论文:Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data
作者:Yangtao Chen*, Zixuan Chen*, Peiyang Wang*, Yong-Lu Li†, Jing Huo†, Jieqi Shi, Yang Gao(*共同一作,†通讯)
机构:上海创智学院(Shanghai Innovation Institute)、南京大学、上海交通大学
发布时间:2026 年 6 月(arXiv 2606.22136v2)
发表状态:未录用(预印本)
分类标签:
数据合成生成式世界模型灵巧操作Egocentric 人手数据VITRA 后训练MANOUnitree G1
一句话总结
把生成式视频世界模型当作可控的 egocentric 人手操作数据引擎:条件化于语言/物体/场景,用 Wan-I2V + Qwen-Image-Edit 造出 5 万条带 3D 手部位姿标注的 WM-H 数据集,再经手部动作重建 + 机器人手视觉编辑转成机器人可训练监督,配少量真机遥操作数据共训 VITRA 骨干。在 Unitree G1 + 因时灵巧手的 18 个真实灵巧操作任务上,零样本成功率从纯真机基线的 8.3% 提到 38.9%(4.7×);消融证明场景对齐、具身对齐与数据规模是增益三大来源,且 WM-H 主要作用是解锁人类视频预训练已有的操作先验,而非从零学灵巧技能。
一、问题与动机
1.1 灵巧操作的数据"不可能三角"
扩展灵巧操作需要跨物体/场景/任务泛化,但现有数据源在规模与场景/具身对齐之间三选二式地权衡:
| 数据源 | 规模 | 与机器人部署对齐 | 短板 |
|---|---|---|---|
| 遥操作(teleop) | 小 | 高 | 采集昂贵、平台专用 |
| 仿真(simulation) | 大 | 中 | sim-to-real 差距 |
| 真实 egocentric 视频 | 大 | 低 | 场景/具身错配(人手 ≠ 灵巧手,日常环境 ≠ 机器人工作台) |
理想数据源应同时可扩展且部署对齐,还要最小化对人类数据采集的依赖。
1.2 核心重构:世界模型作为"可控人手数据生成器"
本文的关键视角转换:把生成式视频世界模型当成算力驱动的合成数据源。它的价值不在于精确模拟机器人动力学,而在于按需生成多样的人-物交互视频,条件化于语言、物体、场景。因此不同于此前把世界模型当作:
- 环境动力学模拟器;
- 机器人轨迹视频生成器;
- 供下游重定向/可供性推理的人手生成器;
- 或训练未来预测策略的骨干;
Wh0 聚焦其作为可控人手数据生成器的角色——场景、物体、任务类型、具身外观都成为"随算力而非人力扩展"的设计变量。
story:用世界模型造人手数据(WM-H)→ 转成机器人可训练监督 → 配少量真机数据共训,把预训练灵巧 VLA "解锁"到可部署。
二、WM-H 数据集构造(可控视频合成)
WM-H 是"World-Model-generated Human-hand data",5 万条、81 帧视频,带 3D 手部位姿标注 + 语言任务描述,生成成本约 5.44 GPU·小时 / 1k 视频。用名词/形容词 h-index 衡量指令多样性(h-index 为
2.1 指令生成:双 Agent 平衡多样性
关键洞察:多样的操作数据集不仅要词汇量大,还要每个词有足够覆盖度——单纯扩词表会让多数词只出现极少次。用双 Agent 系统平衡广度与频次:
- Agent A(LLM 发现者):持续发现可抓取物体的名词与属性形容词,扩充候选词库(如加名词 "mug"、形容词 "red");
- Agent B(平衡采样器):优先采样欠表达的词,用结构化模板
pick the {adj} {noun}组装自然语言指令。
数据库跟踪词频、过滤重复指令,实现 (物体, 属性) 组合空间的系统化均衡覆盖。
2.2 场景与具身对齐的视频合成(三阶段)
管线要在保留视频世界模型自然人-物交互模式的同时,缩小到机器人部署的视觉差距:
(a) 场景图像捕获与编辑:用部署相机在目标机器人工作台采背景图(与策略输入同视点、同分辨率);采集时把人手放进目标交互区,为手大小、物体尺度、相机距离提供尺度锚点。基于对齐背景,用 Qwen-Image-Edit 把指定物体插入场景,得图生视频的初始帧。
(b) 图生视频生成:用 Wan-I2V-A14B 把初始帧动画化,条件化于语言指令生成 egocentric 人手操作视频。为提升运动正确性,用 Qwen3-VL 生成期望手-物状态变化的描述并拼进视频提示。用 LightX2V LoRA 加速把推理步数降到 4 步,支撑大规模合成。
(c) 机器人手编辑(具身对齐):把机器人灵巧手视作"外观不同的手实体",用 Qwen-Image-Edit 在采样帧上把人手替换为真实感机器人手(白色背壳、黑掌、黑指尖、银色前臂),保留原姿态、位置、物体运动与场景。于是同一操作轨迹同时有人手与机器人手两种外观(后者记为 WM-H EA,embodiment-aligned),逼策略聚焦动作语义而非执行者身份。
2.3 手部动作抽取:显式动作监督
沿用 VITRA 的做法,从合成的人手视频(而非机器人视频)抽 3D 手部位姿作动作标签——因为人手重建相对成熟,能在规模化生成视频上恢复可靠运动监督。用 HaWoR 重建手部运动:先逐帧检测手,再回归 MANO 参数 + 手腕位姿;手腕位姿保留在相机坐标系、关节位姿在 MANO 参数空间。需要时用 MegaSAM 做相机跟踪,把逐帧预测关联到视频相机轨迹。
三、Wh0 策略:人-机器人对齐的策略学习
3.1 架构:VITRA 式 VLA
采用 VITRA 式视觉-语言-动作策略:PaliGemma2-3B 视觉-语言骨干编码当前观测 + 语言指令(视场 FoV 作辅助 token 提供视点线索),可学习 cognition token 的末层隐状态作为条件特征,馈入基于扩散的 DiT-B 动作解码器,从当前手部状态预测未来手部运动,每块预测 16 步。
动作空间定义在当前观测
其中
关键对齐技巧:把机器人关节重定向到 MANO,并复用 VITRA 从大规模人类视频预计算的逐关节归一化参数——避免用有限机器人数据做机器人专属归一化,让机器人动作与人类动作空间对齐。
扩散动作解码器用噪声预测 MSE 损失训练:
3.2 训练策略:解锁而非从零学
策略从 VITRA 初始化(在 Ego4D、Epic-Kitchens、EgoExo4D、Something-Something-V2 上预训练),已具备强人-物交互先验。然后在 5 万条 WM-H + 400 条真机遥操作的混合上共微调(co-finetune):每个 batch 抽 28% 遥操作 / 68% WM-H / 4% WM-H EA(机器人手编辑后的具身对齐帧)。这样过采样稀缺真机数据提供稳定的具身专属信号,WM-H 供泛化所需的视觉与语义多样性。冻结视觉编码器,更新骨干 + 扩散动作解码器,lr
用大白话说:VITRA 预训练时已经从海量人类视频里"学会了怎么用手",但只用有限机器人数据后训练会过拟合到见过的任务、丢掉指令跟随能力;WM-H 用大量对齐好的合成数据把这些沉睡的先验"激活"到机器人可执行的形式。
四、实验结果
4.1 实验设置
- 机器人平台:Unitree G1 人形 + 因时(Inspire)灵巧手,头戴 egocentric 相机(经 Apple Vision Pro 遥操作)。
- 训练数据:Vision Pro 采的 400 条专家轨迹(见过的任务与背景,主要是抓取-放置)。
- 评测:18 个任务、4 个场景,每任务 20 试;随机化物体位姿与场景;零样本(无任务专属演示);成功率为主指标。
4.2 Q1:真实世界零样本灵巧操作(Table 1)
| 方法 | 预训练 | 适配数据 | 策略 | 成功率 (%) |
|---|---|---|---|---|
| π₀.₅ | 机器人 | 遥操作 | FT | 7.78 |
| VITRA | 人类 | 遥操作 | FT | 8.3 |
| VITRA Real Version | 人类 | 遥操作 + 真实 ego(HOI4D) | Co-FT | 21.4 |
| Wh0 | 人类 | 遥操作 + WM-H | Co-FT | 38.9 |
- 传统范式(π₀.₅、VITRA 仅遥操作后训练)在实验中过拟合到见过的任务、弱化了指令跟随泛化,仅 ~8%。
- 加人类数据共训(真实 ego 或 WM-H)都大幅提升;Wh0 用合成 WM-H(38.9%)显著超过用真实 egocentric 视频的 VITRA Real Version(21.4%)——世界模型生成的数据因场景/具身对齐,比真实人类视频更适合作机器人监督。
4.3 Q2:WM-H 的哪些性质重要(Table 2)
指标:HO Distance(Hand-Object Distance,手-物距离,衡量语言条件物体接地,越低越好,单位 cm)分"human"(原始人手视频上接地)与"robot"(机器人手编辑后接地)两栏,以及 Task Succ.。
| 变体 | HO (human)↓ | HO (robot)↓ | Task Succ.↑ |
|---|---|---|---|
| 无模型(初始位姿) | 18.9 | 18.9 | — |
| 仅遥操作 | 16.2 | 16.2 | 8.3 |
| w/o 场景对齐 | 14.9 | 14.3 | 20.0 |
| w/o 具身对齐 | 10.2 | 13.8 | 34.7 |
| WM-H 5k | 11.9 | 10.5 | 27.8 |
| WM-H 25k | 11.4 | 9.9 | 32.5 |
| Wh0(WM-H 50k) | 10.6 | 9.6 | 38.9 |
- 去场景对齐:WM-H 仍给出手-物交互模式,但场景分布与视点不再匹配部署,接地与真实成功都受限。
- 去具身对齐:在人手外观下表现好,但换到机器人手外观就退化、任务成功更低——说明其接地不能可靠迁移到机器人具身。Fig 6 显示具身对齐让动作特征在外观变化下更稳定。
- 规模:5k→25k→50k,接地指标与真实成功单调改善——对齐后的数据"越多越有效"。
4.4 Q3:WM-H 是否解锁预训练先验(Table 3)
| 变体 | 人类预训练 | 遥操作 | WM-H | HO Dist.↓ | Task Succ.↑ |
|---|---|---|---|---|---|
| 无模型(初始位姿) | — | — | — | 18.9 | — |
| PaliGemma 预训练 + 遥操作 | ✗ | ✓ | ✗ | 14.3 | 0.8 |
| PaliGemma 预训练 + 遥操作 + WM-H | ✗ | ✓ | ✓ | 12.7 | 0.6 |
| 仅人类预训练 | ✓ | ✗ | ✗ | 13.1 | 0.0 |
| 人类预训练 + 遥操作 | ✓ | ✓ | ✗ | 16.2 | 8.3 |
| Wh0 | ✓ | ✓ | ✓ | 10.6 | 38.9 |
- 仅人类预训练:HO 距离低(有通用人手运动先验)但任务成功 0%——先验不能直接部署到机器人。
- 无人类预训练时,遥操作 + WM-H 也近乎零成功(0.6%)。
- 三者齐备(Wh0)才拿到最佳接地与成功:证明 WM-H 是在激活并对齐预训练的人类操作先验,而非从零学灵巧技能。
4.5 用户研究(72 名 AI 从业者)
- Part A:37.7% 的 AI 生成视频被判为真实;判断依据中物理/布局/接触占 45.6%、手外观/运动 34.9%、低层视觉伪影仅 19.4%——即便是专家也更看重语义一致与物理合理,而非局部瑕疵。
- Part B(5 分制):物体正确性 3.97、指令对齐 4.18、手-物交互 3.95、物理合理性 3.78、训练适用性 3.57。
- Part C:机器人手编辑后姿态一致性 4.30、接触保持 4.25。
五、局限性与未来方向
论文自述:
- 依赖强预训练:WM-H 在没有人类视频预训练骨干时几乎无增益(Table 3),是补充而非替代大规模预训练。
- 生成质量制约:视频生成会产出物理不合理交互、意外物体或长时程不连贯(Appendix 失败案例列了图像编辑错误、穿模、前后不一致、无意义指令、机器人手编辑破坏姿态等)。
- 手部重建误差:手-物遮挡会污染重建的手指姿态、引入噪声监督;机器人手体积更大,执行时可能无意扰动物体。
- 人-机器人形态失配:MANO 手与真实灵巧手存在形态差距。
- 任务范围窄:实验限于单臂抓取-放置;双臂、工具使用、长时程留作未来工作。
六、个人思考
6.1 与 MimicDreamer 的镜像关系
Wh0 与 MimicDreamer 是本目录"数据合成"的一对镜像(详见 MimicDreamer 笔记的对照表):都复用现成骨架后训练、核心贡献都在造数据,但 MimicDreamer 搬运并对齐真实人类演示(动作先验来自真人 EgoDex),Wh0 用生成式世界模型凭空造数据(用算力换数据,~5.44 GPU·h/1k 视频)。一个受真人数据真实性约束,一个受生成质量约束。有意思的是二者结论殊途同归:合成/对齐数据能让平行夹爪(MimicDreamer)或灵巧手(Wh0)显著超越纯真机基线。
6.2 "解锁 > 从头学"是最有价值的观点
Table 3 的 Q3 结论——WM-H 主要在激活预训练先验而非从零学技能——比 4.7× 的成功率数字更有洞察。它呼应了近期一批"预训练存量、后训练解锁"的工作:VITRA/Being-H0 系列先在海量人类视频上学"怎么用手",真正缺的是把这种先验桥接到机器人可执行形式的对齐数据。这解释了为何合成 WM-H(38.9%)能赢过真实 HOI4D 视频(21.4%):真实视频虽真,但场景/视点/具身不对齐,桥接效率反而低。对齐质量 > 数据真实性,在"激活先验"这个目标下成立。
6.3 与 world-models 目录的边界
Wh0 标题里就是 "Generative World Models",但它不提出新的世界模型,而是把现成的 Wan-I2V + Qwen-Image-Edit 当工具,贡献在"如何把生成变成机器人可训练数据 + 共训配方"。它不作 RL 训练场、不预测动作条件未来演化、不以世界模型本身为产出——因此归 data-synthesis 而非 world-models。这与 MimicDreamer 的 H2R Aligner(也是用视频扩散造数据)落位逻辑一致:用世界模型 ≠ 做世界模型。
6.4 与本仓库既有工作的连接
- 与 Qwen-RobotManip 共享"先对齐后规模化"哲学,且都有 H2R 数据合成成分;区别是 Qwen-RobotManip 是完整基础模型(合成只是一环),Wh0 是纯数据 pipeline + 共训配方。
- 与 FLARE 一样用无动作人类视频,但 FLARE 是把人类视频当协同训练的隐式世界模型对齐目标(策略辅助),Wh0 是把生成的人手视频当显式监督数据(一级产出)——恰是 CLAUDE.md 里 reasoning 与 data-synthesis 的分野。
6.5 存疑
- 用户研究 37.7% "判为真实"其实意味着 62.3% 被识破——大量合成数据物理不完全可信,却仍带来 4.7× 提升,暗示 VLA 训练对数据"物理保真度"的要求可能没想象中高,多样性/对齐更重要。这个 trade-off 值得单独研究。
- WM-H EA 只占 batch 4% 却是具身对齐的关键载体,比例是否最优、是否可提高,论文未深入。
参考
- VITRA(Li et al., 2025,arXiv 2510.21571):Wh0 的 VLA 骨架、动作空间与归一化来源,基线之一
- MimicDreamer(Li et al., 2025,arXiv 2509.22199):同为数据合成,用真实人类演示做 H2R 翻译,本文的镜像路线
- Wan(Wan Team, 2025,arXiv 2503.20314):WM-H 的图生视频世界模型底座(Wan-I2V-A14B)
- Qwen-Image-Edit(Wu et al., 2025,arXiv 2508.02324):场景物体插入与机器人手编辑的图像编辑器
- HaWoR(Zhang et al., 2025):从 egocentric 视频重建世界空间手部运动,Wh0 的动作抽取器
- MANO(Romero et al., 2017):参数化手模型,Wh0 的动作表征空间
- π₀.₅(Physical Intelligence, 2025,arXiv 2504.16054):机器人数据预训练 VLA 基线