AI / Technology
LDA-1B:把异构具身数据统一成可训练的世界模型
这篇论文想解决的,不是单纯让机器人学会一个动作,而是让它从大量形态不同、质量不一的具身数据里,一起学到动作、动力学和未来画面。作者把这个方向做成了一个 1B 参数的统一训练系统,并配套整理了 EI-30k 数据集。
为什么要把这些数据放进同一个入口
机器人训练常卡在一个矛盾上:高质量示范少,但低质量轨迹、仿真数据、人类第一人称视频很多。只盯着少量高质量示范,会浪费大量本可以提供“世界怎么变化”信息的数据。
论文给出的判断是,问题不只是数据少,而是数据太碎、表示不一致、质量也不一样。直接在像素里预测未来,会把“物体怎么动”和“画面长什么样”搅在一起,训练既慢又难扩展。
EI-30k 和 DINO 潜空间:先把输入整理成同一种语言
作者先做的是数据入口标准化。EI-30k 覆盖 3 万小时以上的人类与机器人轨迹,既有真实也有仿真,还有带动作和不带动作的第一人称人类数据;动作表示也被统一对齐。
为了少管外观细节、多学可迁移的结构,视觉不直接在原始像素上建模,而是在结构化的 DINO latent space 里预测。这里的直觉是:让模型先看“物体关系和变化”,而不是被颜色、纹理和背景牵着走。
一边学动作,一边学未来画面:UWM 的训练方式
LDA-1B 采用 universal embodied data ingestion,把 dynamics、policy 和 visual forecasting 放进同一套多任务训练里。不同来源的数据不承担同样角色:高质量机器人和人类示范同时训练全部目标,低质量轨迹主要用来学动力学和视觉预测。
训练里还加入了 4 个可学习任务嵌入和 2 个注册 token,用来告诉模型当前是在做动作、前向/逆向动力学,还是视觉预测。异步的视觉流和动作流则交给 multimodal diffusion transformer 处理;文中给出的训练规模是 400k iterations、48 张 NVIDIA H800 GPU、总计 4,608 GPU hours。
结果说明了什么,哪些地方最有分量
实验里最强的信号不是“只会一个任务”,而是它在很多复杂接触任务里都能把成功率抬上去。摘要给出的总体提升是:在接触密集、灵巧和长时程任务上,相比 π0.5 最多分别提升 21%、48%、23%。
在真实机器人上,Galbot G1 的简单 pick-and-place 成功率达到 80%–90%;“Clean the Rubbish” 上 LDA-1B 是 35%,而 GR00T 和 π0.5 都是 0%。在 RoboCasa-GR1 上,LDA 平均成功率 55.4%,高于 GR00T 的 47.6%;像 PnP Bottle To Cabinet Close、PnP Can To Drawer Close 这类带关闭和接触的任务,提升尤其明显。
这套方法的边界在哪里,读结果要怎么理解
论文也明确了几条边界。它聚焦的是具身交互数据,不包含互联网规模的 VQA 数据;当前 UWM 实现仍主要工作在像素空间之外,但实验场景依然偏向 egocentric camera 视角和特定机器人平台。
另一个重要点是,低质量轨迹并没有直接用于策略学习,动作监督仍主要依赖较高质量数据。作者还观察到,早期训练中不同预测目标会互相竞争,但到 400k iterations 后,这种竞争转为正向对齐;这说明统一训练是可行的,但它依赖数据整理、表示选择和训练阶段的协同。
研究附录术语、来源与待验证问题
论文证据
LDA-1B 是一个 1B 参数的统一具身世界模型(UWM)/机器人基础模型,使用 EI-30k 的异构具身数据进行训练。
证据笔记:表 I;引言/第 1 节提到 EI-30k 覆盖真实与仿真环境,并包含机器人与人类轨迹。
论文称,在接触密集、灵巧和长时程任务上,LDA-1B 相比 π0.5 的提升最高分别达到 21%、48% 和 23%。
证据笔记:摘要。
论文称,使用 30% 低质量轨迹进行微调,可额外带来 10% 的数据效率提升。
证据笔记:摘要。
EI-30k 超过 30,000 小时,覆盖真实机器人、仿真机器人、带动作的第一人称人类数据和无动作第一人称人类数据。
证据笔记:第 6 节。
方法上,LDA-1B 通过 universal embodied data ingestion 联合学习 dynamics、policy 和 visual forecasting,并在结构化 DINO latent space 中建模。
证据笔记:第 2 节、第 4 节。
训练流程使用多任务共训练,并用 4 个可学习任务嵌入和 2 个注册 token 统一动作、前向/逆向动力学与视觉预测。
证据笔记:第 2 节。
实验中,LDA 在 Galbot G1、Unitree G1、RoboCasa-GR1 等设置上报告了较强的域内表现,尤其在复杂接触和长时序任务上。
证据笔记:第 3 节、第 5 节、第 6 节。
可解释性分析中,动作条件下的注意力差分 ΔA 被用于展示模型会动态重加权与接触、位移相关的视觉 token。
证据笔记:第 7 节。
能力边界与局限
- 作者明确指出,该方法仍聚焦于具身交互数据,不包含互联网规模 VQA 数据。
- 现有 UWM 实现通常仍在像素空间工作,且未显式处理数据质量、规模和异质性。
- 多项结果主要来自域内测试,跨域泛化与不同本体的外推范围未完全验证。
- 低质量轨迹的收益依赖于混合质量微调设定,未说明对所有任务都稳定成立。
- 可解释性部分主要是定性可视化,缺少对应的定量验证。
和其他方案放在一起看
还不能确定的地方
EI-30k 中真实、仿真、人类数据的精确占比
所给证据只说明覆盖这些来源,没有完整比例分解。
查阅数据集构建与统计表,确认各来源小时数或轨迹数。
21%、48%、23% 与 10% 提升的方差和统计显著性
摘要只给出提升幅度,没有提供误差条或显著性检验。
查看实验表格、附录或补充材料中的多次运行结果。
低质量轨迹参与哪些任务、以何种权重参与训练
证据说明低质量轨迹主要用于动力学和视觉预测,但具体损失权重未完整呈现。
查训练目标公式、数据配比与消融实验。
VLM 与 DINO 编码器冻结/解冻的全部细节
证据提到预训练冻结、微调解冻,但冻结范围和层级未完全展开。
查看方法实现段落与训练配置。
LDA 对所有本体和所有视觉视角的泛化范围
证据主要来自 Galbot G1、Unitree G1、RoboCasa-GR1 等域内评测。
查看跨本体、跨视角或跨域实验是否存在。
ΔA 注意力可视化与真实物理推理之间的对应关系
当前证据是定性解释,尚不足以证明因果机制。
查注意力归因实验、反事实分析或额外可解释性评测。
术语表
- LDA-1B
- 论文提出的 1B 参数具身基础模型,核心任务是联合学习动作、动力学和视觉预测。
- EI-30k
- 作者构建的统一具身数据集,包含 3 万小时以上的人类与机器人轨迹,以及真实、仿真和不同质量的数据。
- universal embodied data ingestion
- 统一摄入异构具身数据的训练方式,让不同来源的数据在同一个模型里承担不同角色。
- DINO latent space
- 从 DINO 视觉编码器得到的潜在表示空间,模型在这里预测未来状态而不是直接预测像素。
- MM-DiT
- multimodal diffusion transformer,用来联合处理视觉和动作等多模态流。
- policy
- 策略,指模型根据当前观察决定下一步动作的部分。
- dynamics
- 动力学,指物体和环境会怎样随动作变化的规律。
- visual forecasting
- 视觉预测,指根据当前状态预测未来会看到什么。
参考来源
来源追踪
摘要: 在接触密集、灵巧和长时程任务上,相比 π0.5 的提升最高分别为 21%、48%、23%。 arXiv PDF
摘要: 使用 30% 低质量轨迹微调可额外带来 10% 的数据效率提升。 arXiv PDF
引言 / 第 1 节: EI-30k 覆盖真实与仿真环境,并包含机器人与人类轨迹。 arXiv PDF
表 I: LDA-1B 使用 Het.、30k+ 数据、Mixed 质量、UWM 训练范式,参数规模为 1B。 arXiv PDF
第 2 节: 提出多任务共训练的数据摄入机制,并用 4 个任务嵌入和 2 个注册 token 统一多种预测目标。 arXiv PDF
第 4 节: 10k iterations 时不同预测目标呈弱负相关;400k iterations 时竞争消失并转为正向 alignment。 arXiv PDF
第 5 节: 在 RoboCasa-GR1 上,LDA 的平均成功率高于 GR00T,且在复杂接触任务中优势更明显。 arXiv PDF
第 6 节: Galbot 与灵巧手任务中,LDA 在多个任务上优于 π0.5 和 GR00T-N1.6。 arXiv PDF
第 7 节: ΔA = |A1 - A2| 用于可视化动作条件下的注意力变化,并展示模型关注接触区域和运动方向。 arXiv PDF
关于这篇论文的三个关键问题
LDA-1B:把异构具身数据统一成可训练的世界模型 解决了什么问题?
这篇论文想解决的,不是单纯让机器人学会一个动作,而是让它从大量形态不同、质量不一的具身数据里,一起学到动作、动力学和未来画面。作者把这个方向做成了一个 1B 参数的统一训练系统,并配套整理了 EI-30k 数据集。
LDA-1B:把异构具身数据统一成可训练的世界模型 的核心结论有哪些证据?
LDA-1B 是一个 1B 参数的统一具身世界模型(UWM)/机器人基础模型,使用 EI-30k 的异构具身数据进行训练。 证据笔记:表 I;引言/第 1 节提到 EI-30k 覆盖真实与仿真环境,并包含机器人与人类轨迹。
阅读 LDA-1B:把异构具身数据统一成可训练的世界模型 时最需要注意什么局限?
作者明确指出,该方法仍聚焦于具身交互数据,不包含互联网规模 VQA 数据。