返回报告库

Robotics / NVIDIA

FLARE让机器人不必画出未来,也能学会“先想后做”

官方题名: FLARE: Robot Learning with Implicit World Modeling
作者: Ruijie Zheng 等|发表: 第 9 届机器人学习会议(CoRL 2025)|论文: arXiv:2505.15659

机器人行动前,真的需要在脑中生成一张高清“未来照片”吗?FLARE 的回答是:不必。它只让策略学会预测未来画面中与行动有关的压缩特征,同时继续学习该怎么动。

画出每个像素,反而可能忘了动作

想象机器人要绕过水瓶去拿苹果。生成未来画面的方法还要预测瓶身反光、桌面纹理和阴影;但控制真正需要的是“瓶子挡在手前”“苹果在右侧”这些线索。FLARE 把未来压成与动作有关的特征,不要求重建整张图。图中要看的是:两条路线面对同一个动作问题,却把计算花在不同地方。

论文据此提出一种更轻的世界建模目标。作者指出,像素生成需要更大的生成模型,而且“画得像”与“动得对”会争用模型容量;但论文没有直接给出推理延迟或 FLOPs 对比,所以“更省”主要是结构上的判断,不是完整的速度基准。(论文第 1 节、第 5 节)

未来 token 是留给“接下来会怎样”的空白便签

FLARE 在原有策略序列里加入 32 个可学习的“未来 token”。可以把它们想成一排空白便签:当前画面、文字指令、机器人关节状态和带噪动作进入模型后,这些便签在中间层写下对未来状态的压缩猜测。它们不输出图片,也不在执行时额外规划一条动作路线。

目标答案来自未来时刻的真实观察:视觉—语言编码器把那一帧压成 32 个特征 token,训练再让“猜测便签”朝这些答案靠近。作者采用 SigLIP2、四层融合 Transformer 和 Q-former 来做压缩;这使多相机输入最终都落到固定大小,但“32 个”是本文的设计选择,不代表所有任务都适合这个容量。(论文第 3.1、3.2 节,附录 A)

一次训练,同时纠正“怎么动”和“会到哪”

训练时有两位教练。第一位看动作:从被噪声打乱的动作中恢复专家动作。第二位看后果:比较未来 token 的猜测与真实未来观察的压缩特征。两条反馈在同一个扩散 Transformer 内汇合,因此策略不是先运行独立世界模型、再运行控制器,而是在学动作时把未来线索写进内部表示。

这里真正回答的问题是:“怎样判断猜到的未来方向对不对?”论文使用

Lalign(θ)=Eτ[cos(fθ(ϕt,Atτ,qt),g(ϕt+H))].\mathcal{L}_{\text{align}}(\theta)=-\mathbb{E}_{\tau}\left[\cos\left(f_{\theta}(\phi_t,A_t^\tau,q_t),g(\phi_{t+H})\right)\right].

输入是当前观察的特征 ϕt\phi_t、带噪动作块 AtτA_t^\tau 和机器人自身状态 qtq_tfθf_\theta 输出未来 token 的猜测,g(ϕt+H)g(\phi_{t+H}) 输出真实未来观察的压缩答案。余弦相似度只比较两个特征方向是否一致:若相似度从 0.4 升到 0.9,前面的负号会让损失从 −0.4 降到 −0.9,训练就把这次猜测视为更好。它不要求特征的绝对长度相同,也不等于未来像素相同。

两位教练的意见合成

L=Lfm+λLalign.\mathcal{L}=\mathcal{L}_{\mathrm{fm}}+\lambda\mathcal{L}_{\text{align}}.

Lfm\mathcal{L}_{\mathrm{fm}} 衡量动作恢复得多好,λ\lambda 决定未来对齐的分量;主实验取 λ=0.2\lambda=0.2。若 λ=0\lambda=0,未来教练完全消失;若它过大,模型可能顾着匹配未来特征而干扰动作学习。消融还显示,把对齐放得太早(第 4 层)会明显掉分,主设置放在 8 层中的第 6 层。(论文公式 2、3,第 4.4 节)

两套模拟任务里,未来对齐都提高了成功率

这张图只比较最直接的对照:同一 FLARE 架构,有没有未来对齐损失。24 个 RoboCasa 厨房任务的平均成功率从 61.9% 升到 70.1%;24 个 GR1 人形机器人桌面任务从 44.0% 升到 55.0%。这分别是 8.2 和 11.0 个百分点,不是“提升 8.2% 和 11%”。

作者还与 UWM、从头训练的 GR00T N1 和 Diffusion Policy 比较,FLARE 在表 1 的两套平均分上都最高。为控制预训练数据影响,这组实验只用各自域内数据训练嵌入模型;UWM 甚至训练了 400k 步,其他方法为 80k 步。不过,报告的是最后五个检查点中的最高成功率,且这些都是模拟模仿学习任务,不能直接推出开放世界可靠性。(论文第 4.1 节、表 1)

没有机器人动作标签的人类视频,也能教“未来长什么样”

人类头戴 GoPro 完成任务时,没有机器人关节动作可供模仿,所以人类视频只走“未来对齐”这条训练支路;少量机器人遥操作示范同时提供动作损失和未来对齐。关键桥梁不是“人的手等于机器人的手”,而是两者都能展示物体从当前状态变到目标状态的视觉过程。

实验选了 5 个训练集没见过、形状各异的物体,每个物体收集 150 段人类第一视角示范,并最多收集 10 段机器人示范。加入人类视频后,1 段机器人示范/物体时最高达到 60%,10 段时达到 80%;后者约为只用带动作数据基线的两倍。这里的成功率允许“抓起但没放进篮子”记 0.5 分,而且视频来自受控环境,不等于随手收集的网络视频也能奏效。(论文第 4.3 节、图 7)

真机结果很亮眼,但证据仍集中在桌面拾放

在 4 个真实 GR1 桌面任务上,用每任务 100 条轨迹做后训练,FLARE 最高成功率为 95.1%,平均比只学动作的基线高 14 个百分点。论文还报告一个行为差异:物体靠近手时,基线常把瓶罐碰倒,而 FLARE 的手会绕过或从上方接近。这是对“内部未来线索可能改善动作”的直观支持,但定性轨迹不能单独证明因果机制。

证据边界同样清楚:真机主要是拾放任务;更精细的灵巧操作、强化学习、自然环境中的大规模人类视频都没有验证。即便面对新物体,方法仍需少量专家机器人示范。因此,较稳妥的结论是“未来潜在对齐在本文任务和数据条件下有效”,而不是“机器人已经拥有通用想象或长期规划能力”。(论文第 4.2 节、第 6 节、附录 E)

研究附录

一句话技术定位

FLARE 是给流匹配/扩散式 VLA 策略增加未来表示预测的联合训练方法。它不显式生成未来图像,也没有在推理时搜索多条未来轨迹。

证据表

问题设置结果读法与边界
域内模拟多任务24 RoboCasa,80k 步FLARE 70.1%;仅策略 61.9%;UWM 60.8%;GR00T N1 从头训练 60.6%;Diffusion Policy 51.7%最后 5 个检查点取最高值
域内模拟多任务24 GR1,80k 步FLARE 55.0%;仅策略 44.0%;UWM 29.5%;GR00T N1 从头训练 45.1%;Diffusion Policy 40.9%UWM 训练 400k 步
目标嵌入消融GR1 模拟无 FLARE 43.9%;SigLIP2 49.6%;平均池化 SigLIP2 50.9%;动作感知嵌入 55.0%支持“通用特征也有用,动作相关特征最好”
跨机体后训练RoboCasa,每任务 1000 条轨迹预训练嵌入 71.3%;域内嵌入 70.2%预训练嵌入未见过 RoboCasa
真实 GR14 项任务,每任务 100 条轨迹最高 95.1%,平均高基线 14 个百分点最终检查点;8 个参考初始帧/任务、4 种物体
新物体 + 人类视频5 个物体1 条机器人轨迹/物体:最高 60%;10 条 + 人类视频:80%抓起未放入计 0.5;受控 GoPro 数据

两个必要公式到底在做什么

未来对齐式中的 τ\tau 是动作加噪程度;AtτA_t^\tau 是被打乱后的动作块;qtq_t 是关节等自身状态;ϕt\phi_tϕt+H\phi_{t+H} 分别是当前和未来观察的视觉—语言表示。fθf_\theta 从策略第 LL 层的 MM 个未来 token 产生预测,gg 是目标编码器。对一个批次和多个 token 取平均后,优化器让预测方向更接近真实未来表示。

总损失只做加权相加。λ\lambda 上升时,未来表示的监督更强;下降时,训练更接近普通动作策略。论文主设置为 0.2,并用消融说明存在中间甜点区。这里省略了流匹配的完整推导,因为理解 FLARE 的新增贡献只需知道:Lfm\mathcal{L}_{\mathrm{fm}} 负责把噪声动作逐步拉回专家动作。

动作感知嵌入模型

SigLIP2 把 256×256 图像变成 256 个图块 token,文字指令补齐为 32 个 token。四层自注意力融合得到 288 个 token,Q-former 再用 32 个查询 token 压缩。作者给这个编码器接上 8 个 DiT 层,并用动作流匹配训练,让压缩表示保留控制所需信息。

预训练数据表总计 169.5M 帧、2,989.5 小时,包含真实机器人和 GR1 模拟数据;正文“约 2,000 小时”与附录总表并不一致。本文以附录表 3 的逐项总计为准,并将差异视为来源内部的不确定项。预训练使用 256 张 H100、batch size 8192、150k 步;下游多任务训练使用 32 张 H100、batch size 1024、80k 步。

论文关系与继承线索

  • REPA(Yu 等,ICLR 2025):论文第 3.1 节明确说方法与 REPA 的表示对齐相似,但把“当前图像特征对齐”改成“策略中的未来观察特征对齐”。
  • GR00T N1(arXiv:2503.14734):第 2 节和第 5 节明确说明采用其流匹配 DiT 架构思路,并使用其部分机器人数据。
  • SigLIP2:第 3.2 节明确采用其视觉和文本编码器。
  • BLIP-2 / Q-former:第 3.2 节与附录 A 明确采用 Q-former,把融合 token 压成固定 32 个查询 token。

术语

术语本文中的意思
潜在表示不是图片,而是一组压缩数字;相近方向应代表与任务有关的相近状态
世界模型学习“现在经过动作后会变成什么”;FLARE 只在潜在空间隐式学习
token模型处理的一小块向量信息;未来 token 是专门承载未来预测的槽位
流匹配从噪声动作出发,学习一个方向,经过少量更新生成连续动作
余弦相似度比较两个向量方向是否一致,范围通常为 −1 到 1
EMA用缓慢移动的参数平均值更新目标编码器,减少目标突然漂移

来源落点

  • 题名、作者、摘要、arXiv 信息:arXiv 摘要页
  • 会议状态:论文首页标注 “9th Conference on Robot Learning (CoRL 2025), Seoul, Korea”;NVIDIA 论文页也列为 CoRL 会议论文。
  • 方法与公式:论文第 2、3 节,尤其公式(2)(3)与图 2。
  • 模拟结果:论文第 4.1 节、表 1。最终 CoRL PDF 的 GR1 “Pick and Place Tasks”为 56.2%;arXiv HTML 转写曾显示不同数值,因此采用最终 PDF。
  • 人类视频与真机:论文第 4.2、4.3 节,图 6、7。
  • 限制:论文第 6 节;算力与数据明细:附录 B、C。

核验问题

  1. 为什么预测未来潜在特征可能比生成未来像素更适合控制?论文又缺少哪类效率证据?
  2. 未来 token 的预测答案从哪里来?执行机器人时还需要未来真实画面吗?
  3. λ=0\lambda=0 时,FLARE 退化成什么训练方式?λ\lambda 过大可能有什么冲突?
  4. 70.1% 对 61.9% 为什么应说“高 8.2 个百分点”?
  5. 人类视频为何不需要机器人动作标签?它仍需要哪一种机器人数据?
  6. 95.1% 能支持哪些结论,又不能支持哪些通用机器人结论?

关于这篇论文的三个关键问题

FLARE:让机器人不必画出未来,也能学会“先想后做” 解决了什么问题?

机器人行动前,真的需要在脑中生成一张高清“未来照片”吗?FLARE 的回答是:不必。它只让策略学会预测未来画面中与行动有关的压缩特征,同时继续学习该怎么动。

FLARE:让机器人不必画出未来,也能学会“先想后做” 的核心结论有哪些证据?

这张图只比较最直接的对照:同一 FLARE 架构,有没有未来对齐损失。24 个 RoboCasa 厨房任务的平均成功率从 61.9% 升到 70.1%;24 个 GR1 人形机器人桌面任务从 44.0% 升到 55.0%。这分别是 8.2 和 11.0 个百分点,不是“提升 8.2% 和 11%”。

阅读 FLARE:让机器人不必画出未来,也能学会“先想后做” 时最需要注意什么局限?

作者还与 UWM、从头训练的 GR00T N1 和 Diffusion Policy 比较,FLARE 在表 1 的两套平均分上都最高。为控制预训练数据影响,这组实验只用各自域内数据训练嵌入模型;UWM 甚至训练了 400k 步,其他方法为 80k 步。不过,报告的是最后五个检查点中的最高成功率,且这些都是模拟模仿学习任务,不能直接推出开放世界可靠性。(论文第 4.1 节、表 1)

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro