Robotics / NVIDIA
FLARE让机器人不必画出未来,也能学会“先想后做”
官方题名: FLARE: Robot Learning with Implicit World Modeling
作者: Ruijie Zheng 等|发表: 第 9 届机器人学习会议(CoRL 2025)|论文: arXiv:2505.15659
机器人行动前,真的需要在脑中生成一张高清“未来照片”吗?FLARE 的回答是:不必。它只让策略学会预测未来画面中与行动有关的压缩特征,同时继续学习该怎么动。
画出每个像素,反而可能忘了动作
想象机器人要绕过水瓶去拿苹果。生成未来画面的方法还要预测瓶身反光、桌面纹理和阴影;但控制真正需要的是“瓶子挡在手前”“苹果在右侧”这些线索。FLARE 把未来压成与动作有关的特征,不要求重建整张图。图中要看的是:两条路线面对同一个动作问题,却把计算花在不同地方。
论文据此提出一种更轻的世界建模目标。作者指出,像素生成需要更大的生成模型,而且“画得像”与“动得对”会争用模型容量;但论文没有直接给出推理延迟或 FLOPs 对比,所以“更省”主要是结构上的判断,不是完整的速度基准。(论文第 1 节、第 5 节)
未来 token 是留给“接下来会怎样”的空白便签
FLARE 在原有策略序列里加入 32 个可学习的“未来 token”。可以把它们想成一排空白便签:当前画面、文字指令、机器人关节状态和带噪动作进入模型后,这些便签在中间层写下对未来状态的压缩猜测。它们不输出图片,也不在执行时额外规划一条动作路线。
目标答案来自未来时刻的真实观察:视觉—语言编码器把那一帧压成 32 个特征 token,训练再让“猜测便签”朝这些答案靠近。作者采用 SigLIP2、四层融合 Transformer 和 Q-former 来做压缩;这使多相机输入最终都落到固定大小,但“32 个”是本文的设计选择,不代表所有任务都适合这个容量。(论文第 3.1、3.2 节,附录 A)
一次训练,同时纠正“怎么动”和“会到哪”
训练时有两位教练。第一位看动作:从被噪声打乱的动作中恢复专家动作。第二位看后果:比较未来 token 的猜测与真实未来观察的压缩特征。两条反馈在同一个扩散 Transformer 内汇合,因此策略不是先运行独立世界模型、再运行控制器,而是在学动作时把未来线索写进内部表示。
这里真正回答的问题是:“怎样判断猜到的未来方向对不对?”论文使用
输入是当前观察的特征 、带噪动作块 和机器人自身状态 ; 输出未来 token 的猜测, 输出真实未来观察的压缩答案。余弦相似度只比较两个特征方向是否一致:若相似度从 0.4 升到 0.9,前面的负号会让损失从 −0.4 降到 −0.9,训练就把这次猜测视为更好。它不要求特征的绝对长度相同,也不等于未来像素相同。
两位教练的意见合成
衡量动作恢复得多好, 决定未来对齐的分量;主实验取 。若 ,未来教练完全消失;若它过大,模型可能顾着匹配未来特征而干扰动作学习。消融还显示,把对齐放得太早(第 4 层)会明显掉分,主设置放在 8 层中的第 6 层。(论文公式 2、3,第 4.4 节)
两套模拟任务里,未来对齐都提高了成功率
这张图只比较最直接的对照:同一 FLARE 架构,有没有未来对齐损失。24 个 RoboCasa 厨房任务的平均成功率从 61.9% 升到 70.1%;24 个 GR1 人形机器人桌面任务从 44.0% 升到 55.0%。这分别是 8.2 和 11.0 个百分点,不是“提升 8.2% 和 11%”。
作者还与 UWM、从头训练的 GR00T N1 和 Diffusion Policy 比较,FLARE 在表 1 的两套平均分上都最高。为控制预训练数据影响,这组实验只用各自域内数据训练嵌入模型;UWM 甚至训练了 400k 步,其他方法为 80k 步。不过,报告的是最后五个检查点中的最高成功率,且这些都是模拟模仿学习任务,不能直接推出开放世界可靠性。(论文第 4.1 节、表 1)
没有机器人动作标签的人类视频,也能教“未来长什么样”
人类头戴 GoPro 完成任务时,没有机器人关节动作可供模仿,所以人类视频只走“未来对齐”这条训练支路;少量机器人遥操作示范同时提供动作损失和未来对齐。关键桥梁不是“人的手等于机器人的手”,而是两者都能展示物体从当前状态变到目标状态的视觉过程。
实验选了 5 个训练集没见过、形状各异的物体,每个物体收集 150 段人类第一视角示范,并最多收集 10 段机器人示范。加入人类视频后,1 段机器人示范/物体时最高达到 60%,10 段时达到 80%;后者约为只用带动作数据基线的两倍。这里的成功率允许“抓起但没放进篮子”记 0.5 分,而且视频来自受控环境,不等于随手收集的网络视频也能奏效。(论文第 4.3 节、图 7)
真机结果很亮眼,但证据仍集中在桌面拾放
在 4 个真实 GR1 桌面任务上,用每任务 100 条轨迹做后训练,FLARE 最高成功率为 95.1%,平均比只学动作的基线高 14 个百分点。论文还报告一个行为差异:物体靠近手时,基线常把瓶罐碰倒,而 FLARE 的手会绕过或从上方接近。这是对“内部未来线索可能改善动作”的直观支持,但定性轨迹不能单独证明因果机制。
证据边界同样清楚:真机主要是拾放任务;更精细的灵巧操作、强化学习、自然环境中的大规模人类视频都没有验证。即便面对新物体,方法仍需少量专家机器人示范。因此,较稳妥的结论是“未来潜在对齐在本文任务和数据条件下有效”,而不是“机器人已经拥有通用想象或长期规划能力”。(论文第 4.2 节、第 6 节、附录 E)
研究附录
一句话技术定位
FLARE 是给流匹配/扩散式 VLA 策略增加未来表示预测的联合训练方法。它不显式生成未来图像,也没有在推理时搜索多条未来轨迹。
证据表
| 问题 | 设置 | 结果 | 读法与边界 |
|---|---|---|---|
| 域内模拟多任务 | 24 RoboCasa,80k 步 | FLARE 70.1%;仅策略 61.9%;UWM 60.8%;GR00T N1 从头训练 60.6%;Diffusion Policy 51.7% | 最后 5 个检查点取最高值 |
| 域内模拟多任务 | 24 GR1,80k 步 | FLARE 55.0%;仅策略 44.0%;UWM 29.5%;GR00T N1 从头训练 45.1%;Diffusion Policy 40.9% | UWM 训练 400k 步 |
| 目标嵌入消融 | GR1 模拟 | 无 FLARE 43.9%;SigLIP2 49.6%;平均池化 SigLIP2 50.9%;动作感知嵌入 55.0% | 支持“通用特征也有用,动作相关特征最好” |
| 跨机体后训练 | RoboCasa,每任务 1000 条轨迹 | 预训练嵌入 71.3%;域内嵌入 70.2% | 预训练嵌入未见过 RoboCasa |
| 真实 GR1 | 4 项任务,每任务 100 条轨迹 | 最高 95.1%,平均高基线 14 个百分点 | 最终检查点;8 个参考初始帧/任务、4 种物体 |
| 新物体 + 人类视频 | 5 个物体 | 1 条机器人轨迹/物体:最高 60%;10 条 + 人类视频:80% | 抓起未放入计 0.5;受控 GoPro 数据 |
两个必要公式到底在做什么
未来对齐式中的 是动作加噪程度; 是被打乱后的动作块; 是关节等自身状态; 与 分别是当前和未来观察的视觉—语言表示。 从策略第 层的 个未来 token 产生预测, 是目标编码器。对一个批次和多个 token 取平均后,优化器让预测方向更接近真实未来表示。
总损失只做加权相加。 上升时,未来表示的监督更强;下降时,训练更接近普通动作策略。论文主设置为 0.2,并用消融说明存在中间甜点区。这里省略了流匹配的完整推导,因为理解 FLARE 的新增贡献只需知道: 负责把噪声动作逐步拉回专家动作。
动作感知嵌入模型
SigLIP2 把 256×256 图像变成 256 个图块 token,文字指令补齐为 32 个 token。四层自注意力融合得到 288 个 token,Q-former 再用 32 个查询 token 压缩。作者给这个编码器接上 8 个 DiT 层,并用动作流匹配训练,让压缩表示保留控制所需信息。
预训练数据表总计 169.5M 帧、2,989.5 小时,包含真实机器人和 GR1 模拟数据;正文“约 2,000 小时”与附录总表并不一致。本文以附录表 3 的逐项总计为准,并将差异视为来源内部的不确定项。预训练使用 256 张 H100、batch size 8192、150k 步;下游多任务训练使用 32 张 H100、batch size 1024、80k 步。
论文关系与继承线索
- REPA(Yu 等,ICLR 2025):论文第 3.1 节明确说方法与 REPA 的表示对齐相似,但把“当前图像特征对齐”改成“策略中的未来观察特征对齐”。
- GR00T N1(arXiv:2503.14734):第 2 节和第 5 节明确说明采用其流匹配 DiT 架构思路,并使用其部分机器人数据。
- SigLIP2:第 3.2 节明确采用其视觉和文本编码器。
- BLIP-2 / Q-former:第 3.2 节与附录 A 明确采用 Q-former,把融合 token 压成固定 32 个查询 token。
术语
| 术语 | 本文中的意思 |
|---|---|
| 潜在表示 | 不是图片,而是一组压缩数字;相近方向应代表与任务有关的相近状态 |
| 世界模型 | 学习“现在经过动作后会变成什么”;FLARE 只在潜在空间隐式学习 |
| token | 模型处理的一小块向量信息;未来 token 是专门承载未来预测的槽位 |
| 流匹配 | 从噪声动作出发,学习一个方向,经过少量更新生成连续动作 |
| 余弦相似度 | 比较两个向量方向是否一致,范围通常为 −1 到 1 |
| EMA | 用缓慢移动的参数平均值更新目标编码器,减少目标突然漂移 |
来源落点
- 题名、作者、摘要、arXiv 信息:arXiv 摘要页。
- 会议状态:论文首页标注 “9th Conference on Robot Learning (CoRL 2025), Seoul, Korea”;NVIDIA 论文页也列为 CoRL 会议论文。
- 方法与公式:论文第 2、3 节,尤其公式(2)(3)与图 2。
- 模拟结果:论文第 4.1 节、表 1。最终 CoRL PDF 的 GR1 “Pick and Place Tasks”为 56.2%;arXiv HTML 转写曾显示不同数值,因此采用最终 PDF。
- 人类视频与真机:论文第 4.2、4.3 节,图 6、7。
- 限制:论文第 6 节;算力与数据明细:附录 B、C。
核验问题
- 为什么预测未来潜在特征可能比生成未来像素更适合控制?论文又缺少哪类效率证据?
- 未来 token 的预测答案从哪里来?执行机器人时还需要未来真实画面吗?
- 时,FLARE 退化成什么训练方式? 过大可能有什么冲突?
- 70.1% 对 61.9% 为什么应说“高 8.2 个百分点”?
- 人类视频为何不需要机器人动作标签?它仍需要哪一种机器人数据?
- 95.1% 能支持哪些结论,又不能支持哪些通用机器人结论?
关于这篇论文的三个关键问题
FLARE:让机器人不必画出未来,也能学会“先想后做” 解决了什么问题?
机器人行动前,真的需要在脑中生成一张高清“未来照片”吗?FLARE 的回答是:不必。它只让策略学会预测未来画面中与行动有关的压缩特征,同时继续学习该怎么动。
FLARE:让机器人不必画出未来,也能学会“先想后做” 的核心结论有哪些证据?
这张图只比较最直接的对照:同一 FLARE 架构,有没有未来对齐损失。24 个 RoboCasa 厨房任务的平均成功率从 61.9% 升到 70.1%;24 个 GR1 人形机器人桌面任务从 44.0% 升到 55.0%。这分别是 8.2 和 11.0 个百分点,不是“提升 8.2% 和 11%”。
阅读 FLARE:让机器人不必画出未来,也能学会“先想后做” 时最需要注意什么局限?
作者还与 UWM、从头训练的 GR00T N1 和 Diffusion Policy 比较,FLARE 在表 1 的两套平均分上都最高。为控制预训练数据影响,这组实验只用各自域内数据训练嵌入模型;UWM 甚至训练了 400k 步,其他方法为 80k 步。不过,报告的是最后五个检查点中的最高成功率,且这些都是模拟模仿学习任务,不能直接推出开放世界可靠性。(论文第 4.1 节、表 1)