LDA-1B:以通用具身数据摄入扩展潜在动力学动作模型
论文:LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion
作者:Jiangran Lyu*、Kai Liu*、Xuheng Zhang*、Haoran Liao、Yusen Feng、Wenxuan Zhu、Tingrui Shen、Jiayi Chen、Jiazhao Zhang、Yifei Dong、Wenbo Cui、Senmao Qi、Shuo Wang、Yixin Zheng、Mi Yan、Xuesong Shi、Haoran Li、Dongbin Zhao、Ming-Yu Liu、Zhizheng Zhang、Li Yi、Yizhou Wang、He Wang(* 共同一作)
机构:北京大学、Galbot、中科院自动化所(CASIA)、北京智源(BAAI)、清华大学、中山大学、NVIDIA
发布时间:2026 年 2 月(arXiv 2602.12215,v2 修订于 2026 年 6 月)
发表状态:RSS 2026(已录用)
分类标签:
机器人基础模型统一世界模型 UWM通用数据摄入DINO 潜在空间MM-DiTFlow Matching质量分层监督
一句话总结
LDA-1B 是一个 1.6B 参数的机器人基础模型,把行为克隆(BC)主导的预训练范式换成统一世界模型(UWM)——用同一个多模态扩散 Transformer 同时建模策略、正向动力学、逆向动力学和视觉预测四个条件分布,并按数据质量分派角色(无动作人类视频只监督视觉预测、低质量轨迹监督动力学、高质量轨迹监督全部目标),从而把 30k+ 小时异构数据全部用起来;关键的可扩展性来自在结构化 DINO 潜在空间(而非像素或 VAE 潜在)中做预测,在 RoboCasa-GR1 上以 1B 参数达 55.4% 平均成功率(超 3B 的 GR00T-N1.6 的 47.6%),真机接触密集/灵巧/长时程任务分别较 π₀.₅ 提升 21%/48%/23%,并能靠 30% 低质量轨迹再涨 10%(这些数据反而会拖垮基线)。
一、问题与动机
1.1 行为克隆丢掉了异构数据里的动力学知识
当前主流机器人基础模型(π₀、RDT、GraspVLA、InternVLA、GR00T 等)几乎都建立在行为克隆上:看专家怎么做,然后拟合"观测 → 动作"的映射
- 只能吃高质量专家数据。BC 要求动作是"正确的",于是大量异构具身数据(次优轨迹、噪声轨迹、无动作的人类视频)要么被丢弃、要么只被弱利用——尽管它们蕴含丰富的、可迁移的物理交互动力学。
- 数据规模被卡死。Being-H0、UniVLA 等混合方法试图纳入异构数据,但主要依赖动作对齐或额外的潜在动作预训练模块,有效数据规模只能到 ~6k 小时量级。
1.2 统一世界模型(UWM)有潜力但没扩展起来
**统一世界模型(Unified World Model, UWM)**提供了另一条路:用一个模型联合优化动力学、策略与视频生成,从而不再只吃专家数据。给定当前观测
- 策略(Policy):
- 正向动力学(Forward Dynamics):
- 逆向动力学(Inverse Dynamics):
- 视觉规划 / 预测(Visual Planning):
原始 UWM 用一个联合扩散模型对动作和观测同时去噪。但现有 UWM 实例远未扩展到基础模型级别,症结有三:
- 数据用得粗糙:异构数据被无差别对待,不区分质量与监督类型,浪费了可迁移的动力学知识;
- 缺乏现成的大规模标准化数据:具身数据高度碎片化,格式、传感器配置、动作表示、标注质量各不相同;
- 像素空间冗余:UWM 在像素空间预测未来,把动力学学习和冗余的外观建模纠缠在一起——光照、纹理、背景杂乱、视角的细微变化就能主导训练目标,让交互相关的动力学学习变得低效。更深层地,UWM 用的 VAE 潜在把外观、几何、动力学在低层特征粒度上纠缠,导致规模一上去就饱和。
1.3 LDA 的核心思路
LDA(Latent Dynamics Action Model)用**通用具身数据摄入(Universal Embodied Data Ingestion)**来突破上述瓶颈,三个支柱:
- 按质量分派角色:异构数据扮演互补角色——无动作人类视频监督视觉预测;低质量轨迹主要贡献动力学与视觉预测;高质量演示同时支撑策略与动力学。这种"质量感知"避免了在专家行为上过拟合,让可迁移动力学得以可扩展地学习。
- 在结构化 DINO 潜在空间做预测:用 DINOv3 编码的语义潜在替代像素/VAE 潜在,抑制冗余外观建模,让动力学学习能跨环境/物体配置泛化。
- 混合频率多模态扩散 Transformer(MM-DiT):把动作专家与视觉专家解耦,只在共享自注意力层交互,处理视觉(3 Hz)与动作(10 Hz)的异步流,在 1B 参数量级稳定训练。
配套构建了 EI-30k——30k+ 小时、格式统一、动作坐标对齐、带质量标注的具身交互数据集。
二、预备知识
2.1 UWM 的联合扩散形式化
原始 UWM 用一个联合 DDPM,对未来动作和观测同时预测噪声,条件于
其中
2.2 Flow Matching
LDA 用 flow matching 而非 DDPM 训练:模型预测一个去噪速度场
2.3 DINO 潜在 vs. VAE 潜在
VAE 潜在为高保真像素重建而优化,把外观、几何、动力学纠缠在低层特征上;DINO(自监督视觉预训练)潜在编码高层语义与空间结构,同时抑制背景噪声和低层视觉变化。LDA 选 DINO 潜在作为视觉预测目标,正是看中它"保留物体级语义和空间一致性、便于动力学跨场景泛化"的性质——这也是本文最关键的消融结论之一(见 §4.2)。
三、核心方法
3.1 统一预测目标与 flow matching 损失
LDA 把未来视觉状态和动作统一表示,以最大化异构数据间的知识共享。视觉预测目标用 DINOv3 潜在(而非 VAE 像素空间);动作用统一的手心(hand-centric)动作空间:基于末端执行器运动的 6-DoF 位姿增量 + 手指配置,平行夹爪用单自由度开合宽度表示,灵巧手用腕坐标系下的关键点表示。这套设计让不同构型、不同操作平台的动作能一致建模。
模型预测速度场
训练时,动作损失和视觉损失按任务规格选择性激活,让异构数据在合适的监督下贡献;推理时,通过指定任务嵌入和对应输入就能灵活调用同一模型执行不同目标。
用大白话说:这就是一个"多面手"扩散模型。你想让它当策略,就喂"干净观测 + 噪声动作 + 视觉占位符",只开动作损失;你想让它当视觉预测器,就喂"干净观测 + 噪声未来视觉 + 动作占位符",只开视觉损失。同一套权重,靠"开哪个损失、填哪个占位符"来变身。
3.2 通用数据摄入:多任务协同训练
四个目标共享一个扩散模型联合训练,异构数据按监督质量各取所需:
| 数据类型 | 是否有动作 | 监督的目标 |
|---|---|---|
| 高质量机器人 / 人类演示 | 有(优质) | 策略 + 动力学 + 视觉预测(全部) |
| 低质量 / 噪声轨迹 | 有(次优) | 仅动力学 + 视觉预测(不监督策略) |
| 无动作人类操作视频 | 无 | 仅视觉预测 |
这种质量感知的数据用法,避免了在专家行为上过拟合,同时把可迁移动力学与动作表示的学习规模化。
实现"缺失模态"与"多目标"的两个巧思:
- 4 个可学习任务嵌入:每个对应一个训练目标(策略 / 正向动力学 / 逆向动力学 / 视觉预测),加到扩散时间步嵌入
上来条件化去噪过程。 - 2 个可学习寄存器 token(register tokens):一个给动作、一个给视觉,作为"该任务中缺席模态"的占位符。例如策略训练时,模型收到"噪声动作 + 视觉寄存器 token(代表未观测的未来状态)";视觉预测时则是"噪声未来视觉 token + 动作寄存器 token"。这样无需改网络拓扑,就能灵活支持不同的输入-输出结构。
3.3 架构:MM-DiT
LDA 用**多模态扩散 Transformer(MM-DiT)**在统一扩散框架里联合去噪动作块、预测未来视觉特征(Fig 2):
- 条件输入:当前观测 + 语言指令经预训练 VLM(Qwen3-VL-4B-Instruct)编码为条件 token;扩散时间步用正弦嵌入;任务信息用可学习任务嵌入。所有条件信号经 **AdaLN(自适应层归一化)**注入每个 Transformer 块。
- 两条模态流:动作组织成定长块并加高斯噪声;未来 DINO 视觉特征并行加噪。两者各自线性投影为 token 嵌入,联合送入 MM-DiT。
- 共享自注意力 + 模态特定投影:每个 MM-DiT 块对拼接后的动作 token 和视觉 token 做多模态自注意力,实现跨模态交互;但 QKV 投影和 FFN 是模态特定的(保留各自的归纳偏置),注意力则跨模态共享。
- 语言经交叉注意力注入,提供高层语义引导。
- 模态特定输出头分别预测去噪后的动作序列和未来视觉特征。
时序上,视觉观测按 3 Hz 采样、动作按 10 Hz 采样:低频视觉减少高相关连续帧的冗余计算,高频动作保留精细控制,两条不同采样率的流靠混合频率设计对齐。
3.4 训练配置与后训练
- 骨架:VLM = Qwen3-VL-4B-Instruct,视觉编码器 = DINOv3-ViT-s,二者在预训练阶段冻结(保留大规模视觉语言先验和视觉表征质量),只训练 MM-DiT 和动作编解码器;微调阶段解冻 VLM 做端到端适配。
- 超参:hidden 1536、16 层、32 注意力头、图像
、DINO 潜在形状 、动作块 16、历史 2 个时间步。 - 规模:48 张 NVIDIA H800,400k 迭代,共 4608 GPU 小时。预训练 batch
,微调 ;AdamW,lr (cosine)。 - 数据高效后训练:一个轻量后训练阶段沿用同样的数据范式,直接利用未经过滤的混合质量遥操作数据,不需要精心筛选的专家演示,显著降低数据采集和标注成本。
3.5 EI-30k 数据集
- 规模构成:30k+ 小时 = 8.03k 真实机器人 + 8.6k 仿真机器人 + 7.2k 有动作人类演示 + 10k 无动作人类视频。全部转成 LeRobot 2.1 格式,统一观测 / 动作 / 语言表示。
- 对齐动作表示:所有物理交互都表示为共享坐标系下的手心运动(机器人:6-DoF 末端位姿 + 夹爪宽度或灵巧手关节;人类:6-DoF 腕位姿 + 完整 MANO 手参数),手动对齐坐标系以支持人机联合学习。
- 质量清洗与标注:用 VLM 归一化语言标注;剔除无意义手-物交互片段;每条轨迹按动作精度和标注完整度打质量标签——不同于激进过滤,保留低质量轨迹以便下游用质量感知训练榨取全谱数据。
- 来源(部分):真机 = OpenX-Embodiment、Agibot World、RoboMIND、Galaxea 等;仿真 = InternData-A1、Behavior-1k;有动作人类 = Ego4D、Epic-Kitchens、Ego-Exo4D、EgoDex、HOI4D、ARCTIC 等;无动作人类 = Egocentric-10k、Taste-Rob 等。
四、实验结果
4.1 仿真:RoboCasa-GR1
在 RoboCasa-GR1(24 个桌面重排 / 铰接物体操作任务,GR-1 人形 + Fourier 灵巧手,头戴 egocentric RGB,每任务 51 次试验,每任务用 1000 条演示微调)上(Table II,成功率 %):
| 模型 | 视觉表征 | MM-DiT | VLM | 平均成功率 |
|---|---|---|---|---|
| GR00T-N1.6(3B) | - | - | Cosmos | 47.6 |
| StarVLA | - | - | Qwen3-VL | 47.8 |
| GR00T-EI10k(1B,本文数据重训) | - | - | Qwen3-VL | 51.3 |
| UWM-0.1B | VAE | ✗ | - | 14.2 |
| UWM-1B | VAE | ✗ | Qwen3-VL | 19.3 |
| UWM(MM-DiT) | VAE | ✓ | Qwen3-VL | 20.0 |
| LDA(DiT) | DINO | ✗ | Qwen3-VL | 48.9 |
| LDA-0.5B | DINO | ✓ | Qwen3-VL | 50.7 |
| LDA-1B | DINO | ✓ | Qwen3-VL | 55.4 |
关键消融结论:
- DINO 潜在 vs. VAE 潜在是决定性的:UWM(MM-DiT) 仅 20.0,把 VAE 换成 DINO 表征后(LDA(DiT))直接跳到 48.9——语义结构化的潜在空间才是有效扩展的前提。仅把 UWM 放大到 1B 或替换 MM-DiT 骨架只带来 19.3/20.0 的边际提升,说明架构约束(VAE 纠缠潜在)从根上限制了性能。
- MM-DiT 多专家设计有效:LDA(DiT) 48.9 → LDA-1B(MM-DiT)55.4,去掉 MM-DiT 掉 6.5。
- 模型规模有利:0.5B → 1B 涨 4.7(50.7 → 55.4),完整协同训练下从 0.1B 到 1B 单调降低动作预测误差。
- 1B 的 LDA 超过 3B 的 GR00T-N1.6(55.4 vs 47.6),且在需要精确放置和关闭动作的接触密集 / 杂乱重排任务上增益最大(如 PnP Bottle To Cabinet Close 76% vs 51.5%、PnP Can To Drawer Close 71% vs 13%)。
4.2 扩展性分析
在 Agibot World 的留出测试集上以动作预测 L1 误差为代理指标(Fig 10):
- UWM 快速饱和:数据/模型一放大,额外监督收益递减甚至变负——根因是 VAE 潜在纠缠外观/几何/动力学,无法支持组合式和因果推理。
- LDA 持续改进:在语义结构化 DINO 潜在里,即便动作标注数据耗尽,继续加 10k 小时无动作视频仍在降低预测误差;30k 小时时误差降到 6.6。跨模型规模(0.1B→1B)LDA 一致优于 UWM。
- 梯度相似性:目标间梯度余弦相似度显示,策略和逆向动力学(都预测动作)、视频生成和正向动力学(都预测 DINO 特征)从早期就强对齐;预测目标不同的目标在 10k 步时轻微竞争(负相关),到 400k 步转为正对齐——LDA 逐渐把异构目标组织进兼容的特征子空间。
4.3 真机实验
在 Galbot G1(两指夹爪 / SharpaWave 22-DoF 灵巧手)和 Unitree G1(BrainCo 10-DoF 灵巧手)上,few-shot 微调(每任务 100 条遥操作,约 50–80% 为专家级、其余含暂停/重试/低效动作的混合质量):
- 夹爪操作(Fig 6,抓放 / 接触密集 / 精细 / 长时程四类):LDA 一致超过 GR00T-N1.6 和 π₀.₅。如 Clean the Rubbish(双臂协调 + 工具使用 + 序列转移)LDA 35% 而 GR00T 与 π₀.₅ 全 0%。
- 灵巧操作(Fig 7):低 DoF 的 Pull Nail(需精确力方向 + 稳定接触)LDA 80%,π₀.₅ 完全失败、GR00T-N1.6 仅 40%;高 DoF 的 Flip Bread(需协调手指运动 + 连续接触)LDA 90%,两个基线都只有 10%。
- 鲁棒泛化(Table III,抓放):LDA 在未见物体 / 背景 / OOD 起始位置分别 60/60/40,π₀.₅ 仅 26.7/20/6.7、GR00T 40/40/20——大规模潜在动力学预训练让模型忽略视觉干扰、聚焦相关物体可供性。
- 数据高效混合质量微调(Table IV):加入低质量轨迹时,LDA 在两个任务上各涨 10%(如 Place Pen 60→70、Bimanually Remove Lid 50→60),而 π₀.₅ 显著退化(60→40)——LDA 能把噪声数据变成泛化增益,基线却被拖垮。
论文摘要给出的真机总体增益:接触密集 +21%、灵巧 +48%、长时程 +23%(相对 π₀.₅);靠 30% 通常有害的低质量轨迹再涨 10%。
五、局限性与未来方向
- 依赖固定的 DINO 视觉特征:视觉编码器全程冻结,预测目标锁定在 DINO 潜在空间,可能约束对新视觉信号的适应。未来方向是联合学习视觉表征与潜在动力学。
- 主要是 egocentric 相机视角:训练数据以头戴/第一人称为主,可能限制对新视角的泛化。
- 扩展到更丰富的感官模态(触觉、力等),推动可扩展、异构数据驱动的机器人基础模型被社区广泛采用。
六、个人思考
- 本质是"给 UWM 换了个能扩展的潜在空间 + 一套质量分层的数据配方"。UWM 的联合建模思想早已存在,LDA 的两个真正 load-bearing 的判断是:(1) VAE 潜在纠缠导致 UWM 撞天花板,换成 DINO 语义潜在才解锁扩展;(2) 数据不能一视同仁,要按质量分派监督角色。消融里 UWM(MM-DiT) 20.0 → LDA(DiT) 48.9 这一跳(仅换潜在空间)几乎是全文最有说服力的证据。
- 与本仓库其他世界模型 / WAM 笔记的坐标:按 WAM 综述(World Action Models: The Next Frontier)的分类,LDA-1B 属于 Joint WAM → 扩散式 → 多流 → 交叉注意力耦合,与 DUST 同族(都用 MM-DiT + 模态特定投影 + 共享注意力)。差异在于:DUST 进一步给两模态独立加噪时间步并异步采样、把自己定位为"世界模型增强 VLA";LDA 则把重心放在"用统一世界模型 + 质量分层数据做基础模型级预训练",并坚持 DINO 潜在。相比 WorldVLA(自回归离散统一动作+世界模型),LDA 是连续扩散路线,规模和数据摄入都更激进。
- DINO 潜在预测这条线与 FLARE(对齐冻结 teacher 的未来 embedding)、SF(VGGT 隐式空间对齐)一脉相承——都在赌"预测语义 embedding 比预测像素更利于策略"。LDA 把这条赌注推到了基础模型 + 30k 小时数据的规模。
- 质量分层 vs. π₀.₅ 的异构协同训练:π₀.₅ 也强调异构多源协同训练,但仍在 BC 框架内、要求动作标注;LDA 用 UWM 的四个角色把"无动作视频"和"低质量轨迹"纳入监督,这是它能吃到 30k 小时、并把低质量数据变成增益的关键。Table IV 里"同样加低质量数据,LDA 涨 π₀.₅ 跌"是这套范式最直接的体现。
- 一个值得追问的点:论文把 VLM 和 DINO 都冻结来"保留先验",但也因此把视觉表征学习完全排除在动力学学习之外——作者自己列为首要局限。如果未来解冻并联合优化视觉表征与潜在动力学,DINO 潜在这条护城河是否还稳,是这条路线接下来最值得观察的变量。
参考
- UWM(Zhu et al., 2025,arXiv 2504.02792):Unified World Model,LDA 的直接前身与最强对照,联合视频+动作扩散做机器人预训练
- π₀.₅(Physical Intelligence, 2025,arXiv 2504.16054):异构多源协同训练 VLA,真机实验最强 BC 基线
- GR00T-N1.6 / GR00T(Bjorck et al., 2025,arXiv 2503.14734):开源人形基础模型,仿真主要对比
- WorldVLA(Cen et al., 2025,arXiv 2506.21539):自回归统一动作+世界模型,同"世界+动作统一"研究问题的不同路线
- DINOv3(Siméoni et al., 2025,arXiv 2508.10104):LDA 视觉预测目标所在的结构化潜在空间
- DINO-WM(Zhou et al., 2024,arXiv 2411.04983):在预训练视觉特征上做世界模型的零样本规划,"DINO 潜在利于动力学"的思想源头
- RoboCasa(Nasiriny et al., 2024,RSS):仿真主基准 RoboCasa-GR1 的基础
- World Action Models: The Next Frontier(Wang et al., 2026,arXiv 2605.12090):WAM 综述,将 LDA-1B 归为多流交叉注意力耦合的 Joint WAM