返回报告库

AI / Technology

LDA-1B:把异构具身数据统一成可训练的世界模型

这篇论文想解决的,不是单纯让机器人学会一个动作,而是让它从大量形态不同、质量不一的具身数据里,一起学到动作、动力学和未来画面。作者把这个方向做成了一个 1B 参数的统一训练系统,并配套整理了 EI-30k 数据集。

为什么要把这些数据放进同一个入口

把碎片数据放进同一个入口

机器人训练常卡在一个矛盾上:高质量示范少,但低质量轨迹、仿真数据、人类第一人称视频很多。只盯着少量高质量示范,会浪费大量本可以提供“世界怎么变化”信息的数据。

论文给出的判断是,问题不只是数据少,而是数据太碎、表示不一致、质量也不一样。直接在像素里预测未来,会把“物体怎么动”和“画面长什么样”搅在一起,训练既慢又难扩展。

EI-30k 和 DINO 潜空间:先把输入整理成同一种语言

先把输入整理成同一种语言

作者先做的是数据入口标准化。EI-30k 覆盖 3 万小时以上的人类与机器人轨迹,既有真实也有仿真,还有带动作和不带动作的第一人称人类数据;动作表示也被统一对齐。

为了少管外观细节、多学可迁移的结构,视觉不直接在原始像素上建模,而是在结构化的 DINO latent space 里预测。这里的直觉是:让模型先看“物体关系和变化”,而不是被颜色、纹理和背景牵着走。

一边学动作,一边学未来画面:UWM 的训练方式

一个模型同时学动作、动力学和未来画面

LDA-1B 采用 universal embodied data ingestion,把 dynamics、policy 和 visual forecasting 放进同一套多任务训练里。不同来源的数据不承担同样角色:高质量机器人和人类示范同时训练全部目标,低质量轨迹主要用来学动力学和视觉预测。

训练里还加入了 4 个可学习任务嵌入和 2 个注册 token,用来告诉模型当前是在做动作、前向/逆向动力学,还是视觉预测。异步的视觉流和动作流则交给 multimodal diffusion transformer 处理;文中给出的训练规模是 400k iterations、48 张 NVIDIA H800 GPU、总计 4,608 GPU hours。

结果说明了什么,哪些地方最有分量

哪些任务提升最明显

实验里最强的信号不是“只会一个任务”,而是它在很多复杂接触任务里都能把成功率抬上去。摘要给出的总体提升是:在接触密集、灵巧和长时程任务上,相比 π0.5 最多分别提升 21%、48%、23%。

在真实机器人上,Galbot G1 的简单 pick-and-place 成功率达到 80%–90%;“Clean the Rubbish” 上 LDA-1B 是 35%,而 GR00T 和 π0.5 都是 0%。在 RoboCasa-GR1 上,LDA 平均成功率 55.4%,高于 GR00T 的 47.6%;像 PnP Bottle To Cabinet Close、PnP Can To Drawer Close 这类带关闭和接触的任务,提升尤其明显。

这套方法的边界在哪里,读结果要怎么理解

这套方法能到哪里,不能到哪里

论文也明确了几条边界。它聚焦的是具身交互数据,不包含互联网规模的 VQA 数据;当前 UWM 实现仍主要工作在像素空间之外,但实验场景依然偏向 egocentric camera 视角和特定机器人平台。

另一个重要点是,低质量轨迹并没有直接用于策略学习,动作监督仍主要依赖较高质量数据。作者还观察到,早期训练中不同预测目标会互相竞争,但到 400k iterations 后,这种竞争转为正向对齐;这说明统一训练是可行的,但它依赖数据整理、表示选择和训练阶段的协同。

研究附录术语、来源与待验证问题

论文证据

高可信

LDA-1B 是一个 1B 参数的统一具身世界模型(UWM)/机器人基础模型,使用 EI-30k 的异构具身数据进行训练。

证据笔记:表 I;引言/第 1 节提到 EI-30k 覆盖真实与仿真环境,并包含机器人与人类轨迹。

高可信

论文称,在接触密集、灵巧和长时程任务上,LDA-1B 相比 π0.5 的提升最高分别达到 21%、48% 和 23%。

证据笔记:摘要。

高可信

论文称,使用 30% 低质量轨迹进行微调,可额外带来 10% 的数据效率提升。

证据笔记:摘要。

高可信

EI-30k 超过 30,000 小时,覆盖真实机器人、仿真机器人、带动作的第一人称人类数据和无动作第一人称人类数据。

证据笔记:第 6 节。

高可信

方法上,LDA-1B 通过 universal embodied data ingestion 联合学习 dynamics、policy 和 visual forecasting,并在结构化 DINO latent space 中建模。

证据笔记:第 2 节、第 4 节。

高可信

训练流程使用多任务共训练,并用 4 个可学习任务嵌入和 2 个注册 token 统一动作、前向/逆向动力学与视觉预测。

证据笔记:第 2 节。

中可信

实验中,LDA 在 Galbot G1、Unitree G1、RoboCasa-GR1 等设置上报告了较强的域内表现,尤其在复杂接触和长时序任务上。

证据笔记:第 3 节、第 5 节、第 6 节。

中可信

可解释性分析中,动作条件下的注意力差分 ΔA 被用于展示模型会动态重加权与接触、位移相关的视觉 token。

证据笔记:第 7 节。

能力边界与局限

  • 作者明确指出,该方法仍聚焦于具身交互数据,不包含互联网规模 VQA 数据。
  • 现有 UWM 实现通常仍在像素空间工作,且未显式处理数据质量、规模和异质性。
  • 多项结果主要来自域内测试,跨域泛化与不同本体的外推范围未完全验证。
  • 低质量轨迹的收益依赖于混合质量微调设定,未说明对所有任务都稳定成立。
  • 可解释性部分主要是定性可视化,缺少对应的定量验证。

和其他方案放在一起看

方案类型优势限制判断
LDA-1B vs π0.5基线比较摘要称在接触密集、灵巧和长时程任务上最高分别提升 21%、48%、23%;部分具体任务中也高于 π0.5。提升来自特定任务与域内评测,完整方差和统计显著性未在所给证据中展开。在所给证据范围内,LDA-1B 优于 π0.5。
LDA-1B vs GR00T基线比较表 VI 与第 6 节显示,LDA 在多个接触丰富与长时序任务上高于 GR00T。GR00T 在少量简单抓放任务上仍有竞争力;结果主要是域内测试。在复杂操作任务上,LDA-1B 更强。
LDA-1B vs Policy Only消融比较证据显示,仅用 action-labeled trajectories 的 Policy Only 目标在加入低质量数据时表现不稳定,而 LDA 的联合训练更稳。缺少完整数值和消融表的全部上下文。联合动力学与视觉预测的训练更稳健。

还不能确定的地方

EI-30k 中真实、仿真、人类数据的精确占比

所给证据只说明覆盖这些来源,没有完整比例分解。

查阅数据集构建与统计表,确认各来源小时数或轨迹数。

21%、48%、23% 与 10% 提升的方差和统计显著性

摘要只给出提升幅度,没有提供误差条或显著性检验。

查看实验表格、附录或补充材料中的多次运行结果。

低质量轨迹参与哪些任务、以何种权重参与训练

证据说明低质量轨迹主要用于动力学和视觉预测,但具体损失权重未完整呈现。

查训练目标公式、数据配比与消融实验。

VLM 与 DINO 编码器冻结/解冻的全部细节

证据提到预训练冻结、微调解冻,但冻结范围和层级未完全展开。

查看方法实现段落与训练配置。

LDA 对所有本体和所有视觉视角的泛化范围

证据主要来自 Galbot G1、Unitree G1、RoboCasa-GR1 等域内评测。

查看跨本体、跨视角或跨域实验是否存在。

ΔA 注意力可视化与真实物理推理之间的对应关系

当前证据是定性解释,尚不足以证明因果机制。

查注意力归因实验、反事实分析或额外可解释性评测。

术语表

LDA-1B
论文提出的 1B 参数具身基础模型,核心任务是联合学习动作、动力学和视觉预测。
EI-30k
作者构建的统一具身数据集,包含 3 万小时以上的人类与机器人轨迹,以及真实、仿真和不同质量的数据。
universal embodied data ingestion
统一摄入异构具身数据的训练方式,让不同来源的数据在同一个模型里承担不同角色。
DINO latent space
从 DINO 视觉编码器得到的潜在表示空间,模型在这里预测未来状态而不是直接预测像素。
MM-DiT
multimodal diffusion transformer,用来联合处理视觉和动作等多模态流。
policy
策略,指模型根据当前观察决定下一步动作的部分。
dynamics
动力学,指物体和环境会怎样随动作变化的规律。
visual forecasting
视觉预测,指根据当前状态预测未来会看到什么。

参考来源

来源追踪

摘要: 在接触密集、灵巧和长时程任务上,相比 π0.5 的提升最高分别为 21%、48%、23%。 arXiv PDF

摘要: 使用 30% 低质量轨迹微调可额外带来 10% 的数据效率提升。 arXiv PDF

引言 / 第 1 节: EI-30k 覆盖真实与仿真环境,并包含机器人与人类轨迹。 arXiv PDF

表 I: LDA-1B 使用 Het.、30k+ 数据、Mixed 质量、UWM 训练范式,参数规模为 1B。 arXiv PDF

第 2 节: 提出多任务共训练的数据摄入机制,并用 4 个任务嵌入和 2 个注册 token 统一多种预测目标。 arXiv PDF

第 4 节: 10k iterations 时不同预测目标呈弱负相关;400k iterations 时竞争消失并转为正向 alignment。 arXiv PDF

第 5 节: 在 RoboCasa-GR1 上,LDA 的平均成功率高于 GR00T,且在复杂接触任务中优势更明显。 arXiv PDF

第 6 节: Galbot 与灵巧手任务中,LDA 在多个任务上优于 π0.5 和 GR00T-N1.6。 arXiv PDF

第 7 节: ΔA = |A1 - A2| 用于可视化动作条件下的注意力变化,并展示模型关注接触区域和运动方向。 arXiv PDF

关于这篇论文的三个关键问题

LDA-1B:把异构具身数据统一成可训练的世界模型 解决了什么问题?

这篇论文想解决的,不是单纯让机器人学会一个动作,而是让它从大量形态不同、质量不一的具身数据里,一起学到动作、动力学和未来画面。作者把这个方向做成了一个 1B 参数的统一训练系统,并配套整理了 EI-30k 数据集。

LDA-1B:把异构具身数据统一成可训练的世界模型 的核心结论有哪些证据?

LDA-1B 是一个 1B 参数的统一具身世界模型(UWM)/机器人基础模型,使用 EI-30k 的异构具身数据进行训练。 证据笔记:表 I;引言/第 1 节提到 EI-30k 覆盖真实与仿真环境,并包含机器人与人类轨迹。

阅读 LDA-1B:把异构具身数据统一成可训练的世界模型 时最需要注意什么局限?

作者明确指出,该方法仍聚焦于具身交互数据,不包含互联网规模 VQA 数据。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro