Skip to content

Wh0:把生成式世界模型当作可扩展的 egocentric 人手操作数据源

论文Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data

作者:Yangtao Chen*, Zixuan Chen*, Peiyang Wang*, Yong-Lu Li†, Jing Huo†, Jieqi Shi, Yang Gao(*共同一作,†通讯)

机构:上海创智学院(Shanghai Innovation Institute)、南京大学、上海交通大学

发布时间:2026 年 6 月(arXiv 2606.22136v2)

发表状态:未录用(预印本)

🔗 arXiv | PDF | 项目主页

分类标签数据合成 生成式世界模型 灵巧操作 Egocentric 人手数据 VITRA 后训练 MANO Unitree G1


一句话总结

把生成式视频世界模型当作可控的 egocentric 人手操作数据引擎:条件化于语言/物体/场景,用 Wan-I2V + Qwen-Image-Edit 造出 5 万条带 3D 手部位姿标注的 WM-H 数据集,再经手部动作重建 + 机器人手视觉编辑转成机器人可训练监督,配少量真机遥操作数据共训 VITRA 骨干。在 Unitree G1 + 因时灵巧手的 18 个真实灵巧操作任务上,零样本成功率从纯真机基线的 8.3% 提到 38.9%(4.7×);消融证明场景对齐、具身对齐与数据规模是增益三大来源,且 WM-H 主要作用是解锁人类视频预训练已有的操作先验,而非从零学灵巧技能。


一、问题与动机

1.1 灵巧操作的数据"不可能三角"

扩展灵巧操作需要跨物体/场景/任务泛化,但现有数据源在规模场景/具身对齐之间三选二式地权衡:

数据源规模与机器人部署对齐短板
遥操作(teleop)采集昂贵、平台专用
仿真(simulation)sim-to-real 差距
真实 egocentric 视频场景/具身错配(人手 ≠ 灵巧手,日常环境 ≠ 机器人工作台)

理想数据源应同时可扩展部署对齐,还要最小化对人类数据采集的依赖。

1.2 核心重构:世界模型作为"可控人手数据生成器"

本文的关键视角转换:把生成式视频世界模型当成算力驱动的合成数据源。它的价值不在于精确模拟机器人动力学,而在于按需生成多样的人-物交互视频,条件化于语言、物体、场景。因此不同于此前把世界模型当作:

  • 环境动力学模拟器;
  • 机器人轨迹视频生成器;
  • 供下游重定向/可供性推理的人手生成器;
  • 或训练未来预测策略的骨干;

Wh0 聚焦其作为可控人手数据生成器的角色——场景、物体、任务类型、具身外观都成为"随算力而非人力扩展"的设计变量。

story:用世界模型造人手数据(WM-H)→ 转成机器人可训练监督 → 配少量真机数据共训,把预训练灵巧 VLA "解锁"到可部署。


二、WM-H 数据集构造(可控视频合成)

WM-H 是"World-Model-generated Human-hand data",5 万条、81 帧视频,带 3D 手部位姿标注 + 语言任务描述,生成成本约 5.44 GPU·小时 / 1k 视频。用名词/形容词 h-index 衡量指令多样性(h-index 为 h 意为至少 h 个词各出现在至少 h 个样本里):名词 h-index 201、形容词 h-index 117,覆盖广泛的 pick/place/grasp 指令。管线三部分:指令生成、场景与具身对齐的视频合成、手部动作抽取。

2.1 指令生成:双 Agent 平衡多样性

关键洞察:多样的操作数据集不仅要词汇量大,还要每个词有足够覆盖度——单纯扩词表会让多数词只出现极少次。用双 Agent 系统平衡广度与频次:

  1. Agent A(LLM 发现者):持续发现可抓取物体的名词与属性形容词,扩充候选词库(如加名词 "mug"、形容词 "red");
  2. Agent B(平衡采样器):优先采样欠表达的词,用结构化模板 pick the {adj} {noun} 组装自然语言指令。

数据库跟踪词频、过滤重复指令,实现 (物体, 属性) 组合空间的系统化均衡覆盖。

2.2 场景与具身对齐的视频合成(三阶段)

管线要在保留视频世界模型自然人-物交互模式的同时,缩小到机器人部署的视觉差距:

(a) 场景图像捕获与编辑:用部署相机在目标机器人工作台采背景图(与策略输入同视点、同分辨率);采集时把人手放进目标交互区,为手大小、物体尺度、相机距离提供尺度锚点。基于对齐背景,用 Qwen-Image-Edit 把指定物体插入场景,得图生视频的初始帧。

(b) 图生视频生成:用 Wan-I2V-A14B 把初始帧动画化,条件化于语言指令生成 egocentric 人手操作视频。为提升运动正确性,用 Qwen3-VL 生成期望手-物状态变化的描述并拼进视频提示。用 LightX2V LoRA 加速把推理步数降到 4 步,支撑大规模合成。

(c) 机器人手编辑(具身对齐):把机器人灵巧手视作"外观不同的手实体",用 Qwen-Image-Edit 在采样帧上把人手替换为真实感机器人手(白色背壳、黑掌、黑指尖、银色前臂),保留原姿态、位置、物体运动与场景。于是同一操作轨迹同时有人手与机器人手两种外观(后者记为 WM-H EA,embodiment-aligned),逼策略聚焦动作语义而非执行者身份。

2.3 手部动作抽取:显式动作监督

沿用 VITRA 的做法,从合成的人手视频(而非机器人视频)抽 3D 手部位姿作动作标签——因为人手重建相对成熟,能在规模化生成视频上恢复可靠运动监督。用 HaWoR 重建手部运动:先逐帧检测手,再回归 MANO 参数 + 手腕位姿;手腕位姿保留在相机坐标系、关节位姿在 MANO 参数空间。需要时用 MegaSAM 做相机跟踪,把逐帧预测关联到视频相机轨迹。


三、Wh0 策略:人-机器人对齐的策略学习

3.1 架构:VITRA 式 VLA

采用 VITRA 式视觉-语言-动作策略:PaliGemma2-3B 视觉-语言骨干编码当前观测 + 语言指令(视场 FoV 作辅助 token 提供视点线索),可学习 cognition token 的末层隐状态作为条件特征,馈入基于扩散的 DiT-B 动作解码器,从当前手部状态预测未来手部运动,每块预测 16 步。

动作空间定义在当前观测 ot 的相机坐标系,维度 102:

at=[Δtl,Δrl,θhl,Δtr,Δrr,θhr]R102

其中 Δt,ΔrR3 是相邻帧间的相对手腕平移与旋转(欧拉角),θhR15×3 编码 15-DoF MANO 手模型在局部坐标系的关节旋转,上标 l,r 为左/右手(本文聚焦右手操作)。每手 3+3+45=51 维,双手共 102。

关键对齐技巧:把机器人关节重定向到 MANO,并复用 VITRA 从大规模人类视频预计算的逐关节归一化参数——避免用有限机器人数据做机器人专属归一化,让机器人动作与人类动作空间对齐。

扩散动作解码器用噪声预测 MSE 损失训练:

LMSE=EϵN(0,1),i[ϵ^iϵ22]

ϵ^i 为扩散步 i 的预测噪声。

3.2 训练策略:解锁而非从零学

策略从 VITRA 初始化(在 Ego4D、Epic-Kitchens、EgoExo4D、Something-Something-V2 上预训练),已具备强人-物交互先验。然后在 5 万条 WM-H + 400 条真机遥操作的混合上共微调(co-finetune):每个 batch 抽 28% 遥操作 / 68% WM-H / 4% WM-H EA(机器人手编辑后的具身对齐帧)。这样过采样稀缺真机数据提供稳定的具身专属信号,WM-H 供泛化所需的视觉与语义多样性。冻结视觉编码器,更新骨干 + 扩散动作解码器,lr 1×105、VLM weight decay 0.1。

用大白话说:VITRA 预训练时已经从海量人类视频里"学会了怎么用手",但只用有限机器人数据后训练会过拟合到见过的任务、丢掉指令跟随能力;WM-H 用大量对齐好的合成数据把这些沉睡的先验"激活"到机器人可执行的形式。


四、实验结果

4.1 实验设置

  • 机器人平台:Unitree G1 人形 + 因时(Inspire)灵巧手,头戴 egocentric 相机(经 Apple Vision Pro 遥操作)。
  • 训练数据:Vision Pro 采的 400 条专家轨迹(见过的任务与背景,主要是抓取-放置)。
  • 评测:18 个任务、4 个场景,每任务 20 试;随机化物体位姿与场景;零样本(无任务专属演示);成功率为主指标。

4.2 Q1:真实世界零样本灵巧操作(Table 1)

方法预训练适配数据策略成功率 (%)
π₀.₅机器人遥操作FT7.78
VITRA人类遥操作FT8.3
VITRA Real Version人类遥操作 + 真实 ego(HOI4D)Co-FT21.4
Wh0人类遥操作 + WM-HCo-FT38.9
  • 传统范式(π₀.₅、VITRA 仅遥操作后训练)在实验中过拟合到见过的任务、弱化了指令跟随泛化,仅 ~8%。
  • 加人类数据共训(真实 ego 或 WM-H)都大幅提升;Wh0 用合成 WM-H(38.9%)显著超过用真实 egocentric 视频的 VITRA Real Version(21.4%)——世界模型生成的数据因场景/具身对齐,比真实人类视频更适合作机器人监督。

4.3 Q2:WM-H 的哪些性质重要(Table 2)

指标:HO Distance(Hand-Object Distance,手-物距离,衡量语言条件物体接地,越低越好,单位 cm)分"human"(原始人手视频上接地)与"robot"(机器人手编辑后接地)两栏,以及 Task Succ.。

变体HO (human)↓HO (robot)↓Task Succ.↑
无模型(初始位姿)18.918.9
仅遥操作16.216.28.3
w/o 场景对齐14.914.320.0
w/o 具身对齐10.213.834.7
WM-H 5k11.910.527.8
WM-H 25k11.49.932.5
Wh0(WM-H 50k)10.69.638.9
  • 去场景对齐:WM-H 仍给出手-物交互模式,但场景分布与视点不再匹配部署,接地与真实成功都受限。
  • 去具身对齐:在人手外观下表现好,但换到机器人手外观就退化、任务成功更低——说明其接地不能可靠迁移到机器人具身。Fig 6 显示具身对齐让动作特征在外观变化下更稳定。
  • 规模:5k→25k→50k,接地指标与真实成功单调改善——对齐后的数据"越多越有效"。

4.4 Q3:WM-H 是否解锁预训练先验(Table 3)

变体人类预训练遥操作WM-HHO Dist.↓Task Succ.↑
无模型(初始位姿)18.9
PaliGemma 预训练 + 遥操作14.30.8
PaliGemma 预训练 + 遥操作 + WM-H12.70.6
仅人类预训练13.10.0
人类预训练 + 遥操作16.28.3
Wh010.638.9
  • 仅人类预训练:HO 距离低(有通用人手运动先验)但任务成功 0%——先验不能直接部署到机器人。
  • 无人类预训练时,遥操作 + WM-H 也近乎零成功(0.6%)。
  • 三者齐备(Wh0)才拿到最佳接地与成功:证明 WM-H 是在激活并对齐预训练的人类操作先验,而非从零学灵巧技能。

4.5 用户研究(72 名 AI 从业者)

  • Part A:37.7% 的 AI 生成视频被判为真实;判断依据中物理/布局/接触占 45.6%、手外观/运动 34.9%、低层视觉伪影仅 19.4%——即便是专家也更看重语义一致与物理合理,而非局部瑕疵。
  • Part B(5 分制):物体正确性 3.97、指令对齐 4.18、手-物交互 3.95、物理合理性 3.78、训练适用性 3.57。
  • Part C:机器人手编辑后姿态一致性 4.30、接触保持 4.25。

五、局限性与未来方向

论文自述:

  1. 依赖强预训练:WM-H 在没有人类视频预训练骨干时几乎无增益(Table 3),是补充而非替代大规模预训练。
  2. 生成质量制约:视频生成会产出物理不合理交互、意外物体或长时程不连贯(Appendix 失败案例列了图像编辑错误、穿模、前后不一致、无意义指令、机器人手编辑破坏姿态等)。
  3. 手部重建误差:手-物遮挡会污染重建的手指姿态、引入噪声监督;机器人手体积更大,执行时可能无意扰动物体。
  4. 人-机器人形态失配:MANO 手与真实灵巧手存在形态差距。
  5. 任务范围窄:实验限于单臂抓取-放置;双臂、工具使用、长时程留作未来工作。

六、个人思考

6.1 与 MimicDreamer 的镜像关系

Wh0 与 MimicDreamer 是本目录"数据合成"的一对镜像(详见 MimicDreamer 笔记的对照表):都复用现成骨架后训练、核心贡献都在造数据,但 MimicDreamer 搬运并对齐真实人类演示(动作先验来自真人 EgoDex),Wh0 用生成式世界模型凭空造数据(用算力换数据,~5.44 GPU·h/1k 视频)。一个受真人数据真实性约束,一个受生成质量约束。有意思的是二者结论殊途同归:合成/对齐数据能让平行夹爪(MimicDreamer)或灵巧手(Wh0)显著超越纯真机基线。

6.2 "解锁 > 从头学"是最有价值的观点

Table 3 的 Q3 结论——WM-H 主要在激活预训练先验而非从零学技能——比 4.7× 的成功率数字更有洞察。它呼应了近期一批"预训练存量、后训练解锁"的工作:VITRA/Being-H0 系列先在海量人类视频上学"怎么用手",真正缺的是把这种先验桥接到机器人可执行形式的对齐数据。这解释了为何合成 WM-H(38.9%)能赢过真实 HOI4D 视频(21.4%):真实视频虽真,但场景/视点/具身不对齐,桥接效率反而低。对齐质量 > 数据真实性,在"激活先验"这个目标下成立。

6.3 与 world-models 目录的边界

Wh0 标题里就是 "Generative World Models",但它不提出新的世界模型,而是把现成的 Wan-I2V + Qwen-Image-Edit 当工具,贡献在"如何把生成变成机器人可训练数据 + 共训配方"。它不作 RL 训练场、不预测动作条件未来演化、不以世界模型本身为产出——因此归 data-synthesis 而非 world-models。这与 MimicDreamer 的 H2R Aligner(也是用视频扩散造数据)落位逻辑一致:用世界模型 ≠ 做世界模型

6.4 与本仓库既有工作的连接

  • Qwen-RobotManip 共享"先对齐后规模化"哲学,且都有 H2R 数据合成成分;区别是 Qwen-RobotManip 是完整基础模型(合成只是一环),Wh0 是纯数据 pipeline + 共训配方。
  • FLARE 一样用无动作人类视频,但 FLARE 是把人类视频当协同训练的隐式世界模型对齐目标(策略辅助),Wh0 是把生成的人手视频当显式监督数据(一级产出)——恰是 CLAUDE.md 里 reasoning 与 data-synthesis 的分野。

6.5 存疑

  • 用户研究 37.7% "判为真实"其实意味着 62.3% 被识破——大量合成数据物理不完全可信,却仍带来 4.7× 提升,暗示 VLA 训练对数据"物理保真度"的要求可能没想象中高,多样性/对齐更重要。这个 trade-off 值得单独研究。
  • WM-H EA 只占 batch 4% 却是具身对齐的关键载体,比例是否最优、是否可提高,论文未深入。

参考

  • VITRA(Li et al., 2025,arXiv 2510.21571):Wh0 的 VLA 骨架、动作空间与归一化来源,基线之一
  • MimicDreamer(Li et al., 2025,arXiv 2509.22199):同为数据合成,用真实人类演示做 H2R 翻译,本文的镜像路线
  • Wan(Wan Team, 2025,arXiv 2503.20314):WM-H 的图生视频世界模型底座(Wan-I2V-A14B)
  • Qwen-Image-Edit(Wu et al., 2025,arXiv 2508.02324):场景物体插入与机器人手编辑的图像编辑器
  • HaWoR(Zhang et al., 2025):从 egocentric 视频重建世界空间手部运动,Wh0 的动作抽取器
  • MANO(Romero et al., 2017):参数化手模型,Wh0 的动作表征空间
  • π₀.₅(Physical Intelligence, 2025,arXiv 2504.16054):机器人数据预训练 VLA 基线