返回报告库

Robotics / NVIDIA

PLD机器人基础模型怎样主动找到失败区域,再把修正经验学回自己?

官方标题:Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
作者:Wenli Xiao 等|ICLR 2026 论文|arXiv:2511.00091

机器人基础模型通常先看图像和文字指令,再输出机械臂动作。PLD 关心的不是重新造一个更大的模型,而是让已有模型亲自暴露容易失败的状态,借一个轻量“纠偏器”练出恢复动作,最后把这些经验教回原模型。

先别改模型:让它把自己带到容易出错的地方

图中最该注意的是:通才模型 πb\pi_b 被冻结,它原来会什么、会在哪里犯错,都先保留下来。真实部署中的失败往往不在整洁的人类示范里,而在模型自己造成的局面里,例如把方块推到桌角后夹爪卡住。PLD 因此让模型先行动,用它实际会经过的状态来定义“该补哪一课”。(论文第 1、3 节;真实方块案例见第 4.4 节)

这里的边界是,PLD 仍需要一个已经具备基本能力的 VLA 作为起点。论文没有证明它能从毫无任务能力的策略开始自我改进。

一个小纠偏器,沿着原动作附近寻找更好的下一步

基础模型先提出动作 aba_b,轻量残差策略再给出修正量 aδa_\delta,机械臂实际执行

aˉ=ab+aδ.\bar a=a_b+a_\delta.

这条式子回答的是:“如果大模型方向大致对,只差最后一点,怎样低成本地试错?”输入是基础动作和纠偏量;加法把两者合成实际动作。比如基础模型准备向右移动 4 cm,而纠偏器判断会撞到杯子,给出向左 1 cm 的修正,最后就是向右 3 cm。aδa_\delta 接近零时,系统几乎照旧;它变大时,探索更积极,但也更可能偏离通才模型熟悉的行为。论文用调度器把初期修正范围限制在 [ξ,ξ][-\xi,\xi]。(论文第 3.1 节,式 2)

纠偏器靠稀疏的成功/失败奖励学习,并从基础模型的成功轨迹与在线试错中各抽一半样本回放。它能让 120 多个报告任务上的专用策略超过 95% 成功率;这说明探测器能学会任务,不等于最终通才模型已经学会。(论文第 3.1、4.1 节)

不是让专家从头表演,而是在通才走偏后接手

纯 RL 专家常走一条又快又窄的成功路线,但部署中的通才模型未必会来到那条路线。PLD 先让基础模型走随机长度的前缀,到 TbaseT_{base} 后再让残差专家接管:

π(st)={abase,t<Tbaseabase+aδ,tTbase.\pi(s_t)= \begin{cases} a_{base},&t<T_{base}\\ a_{base}+a_{\delta},&t\geq T_{base}. \end{cases}

这条分段规则回答的是:“何时照着通才走,何时开始纠偏?”输入是当前步数 tt 和随机接管点 TbaseT_{base};比较两者后,输出基础动作或修正后的动作。若 Tbase=3T_{base}=3,前 3 步由通才执行,第 4 步起由专家纠偏。接管越晚,专家越常看到通才亲自造成的困难状态;但论文图 4 显示,增加探测长度带来的微调收益最终会饱和。(论文第 3.2 节、算法 1)

只留下成功恢复,再把多位专家的经验教回通才

每个任务都有自己的轻量专家,但最终产品不需要同时携带一堆专家。PLD 收集成功的“通才前缀 + 专家恢复”轨迹,汇成多任务数据,再用标准监督微调让原 VLA 模仿整条动作序列。训练后部署的仍是一个通才模型;论文在自回归动作头 OpenVLA 和流匹配动作头 π0\pi_0 上都测试了这条路线。(论文第 3 节、第 4.2 节)

“成功筛选”很关键,也带来限制:数据告诉模型哪些恢复奏效,却没有直接教安全约束。作者把安全受限的数据收集列为未来工作;当前结果不能推出无人看守的开放环境部署已经安全。(论文第 6 节)

仿真结果:两类动作头都变强,但幅度并不一样

LIBERO 上,π0\pi_0 的平均成功率从 93.4% 升到 97.2%,OpenVLA 从 91.8% 升到 99.2%。SimplerEnv 的四任务平均值从 71.8% 升到 96.6%;单项最大绝对增幅是“夹取胡萝卜”的 50.6 个百分点。图中使用论文表 1、表 2 的原始数值;每项测试预算相同,LIBERO 每个任务评估 50 次。(论文第 4.1、4.2 节)

这些是指定仿真基准上的成功率,不是所有机器人任务的平均能力。论文还发现,LIBERO 长时程迁移中 PLD 优于基础策略自举数据,却仍落后于人类示范。(论文第 4.3 节)

真机证据:恢复覆盖带来 30/30,但“100%”要看清范围

Franka 的随机方块抓取中,PLD 数据微调得到 30/30,RLPD 数据为 16/30,人类数据为 10/30;三者在插销任务上都是 30/30。区别出现在桌角状态:PLD 的混合轨迹包含把方块重新摆正再抓取的恢复动作。每种自动数据集包含 200 条成功轨迹,残差策略在两项任务上 2 小时内学到 100%。(论文第 4.4 节)

双臂 YAM 系统还连续运行了至少 1 小时的显卡插拔循环,但论文明确说每个阶段的单次成功率并非 100%,系统靠恢复维持循环。因而“100%”只适用于论文写明的特定试验口径,不能外推为任意物体、任意环境或长期无故障运行。(论文第 4.4 节)

研究附录

一句话还原训练闭环

冻结通才 VLA → 用残差策略在它的动作附近试错 → 让通才先走随机步数、专家再恢复 → 只收集成功的混合轨迹 → 用监督微调把轨迹蒸馏回通才 → 单独部署更新后的 VLA。

证据表

问题设置原始结果来源
PLD 能否改善两类动作头?LIBERO,平均成功率π0\pi_0: 93.4→97.2;OpenVLA: 91.8→99.2表 1,第 4.2 节
能否跨到另一仿真基准?SimplerEnv 四任务平均71.8→96.6表 2
覆盖少量任务时能否迁移?只用 LIBERO-90 的 10% 任务训练PLD 总体 31.4%,未见任务 24.4%;人类数据 27.2%/21.4%;基础策略数据 10.3%/5.6%表 3
真机恢复是否改善抓取?Franka 方块,30 次随机试验PLD 30/30;RLPD 16/30;人类 10/30第 4.4 节
长时间循环是否完全无失败?YAM 双臂显卡四阶段循环至少连续 1 小时;各阶段单次成功率并非 100%第 4.4 节

必要数学:价值估计在问什么

残差策略需要判断:“眼前这个动作不仅现在有用,是否还会把机器人带到以后更容易成功的位置?”论文用

Qπˉ(st,aˉt)r(s,a)+γEst+1p(st,aˉt)[Qtargetπˉ(st+1,aˉt+1)],aˉ=ab+aδ.Q^{\bar{\pi}}(s_t,\bar a_t)\leftarrow r(s,a)+\gamma\, \mathbb E_{s_{t+1}\sim p(\cdot|s_t,\bar a_t)} \left[Q_{target}^{\bar{\pi}}(s_{t+1},\bar a_{t+1})\right], \qquad \bar a=a_b+a_\delta.

输入是当前状态 sts_t、合成动作 aˉt\bar a_t、立即奖励 rr、下一状态的可能分布 pp,以及未来价值估计 QtargetQ_{target}E\mathbb E 表示把不同可能的下一状态按其发生概率求平均;γ\gamma 决定未来回报占多大分量。操作先看眼前是否成功,再加上折扣后的未来希望,输出当前动作的价值 QQ。若 γ=0\gamma=0,只看眼前;若更接近 1,系统更重视稍后才能完成的动作链。论文使用二元稀疏奖励,因此大量中间步的 rr 为 0,离线成功轨迹和未来价值估计帮助学习信号向前传。

一个极小例子:当前没成功,所以 r=0r=0;下一步有两种同概率结果,未来价值分别为 1 和 0;若 γ=0.8\gamma=0.8,当前动作的目标价值就是 0+0.8×(1+0)/2=0.40+0.8\times(1+0)/2=0.4。它不是成功概率的严格定义,而是训练评论家网络时使用的目标量。

术语

术语本文里的意思
VLA读取视觉、语言目标并输出机器人动作的模型
通才 / 基础策略 πb\pi_b冻结后负责先行动、也负责暴露自身状态分布的原模型
残差策略 πδ\pi_\delta不替代基础动作,只学习一个可加到其上的修正量
探测让基础策略先走若干步,把专家送到它常见或容易失败的状态
分布对齐收集到的训练状态接近部署时基础模型真的会遇到的状态
蒸馏用成功轨迹做监督微调,把专用恢复能力写回一个通才模型

关系与来源依据

  • π0\pi_0 是论文默认基础 VLA;方法直接在它的行为先验上学习残差并回写能力。(第 3 节、第 4 节;Black et al., 2024)
  • 离线与在线回放的设计建立在 RLPD 的离线数据高效在线强化学习上。(第 3.1 节;Ball et al., 2023)
  • 基础策略预热与 WSRL 被论文明确并列讨论,并作为相关消融基线。(第 3.1 节、附录 B.1;Zhou et al., 2024)
  • 评论家用 Cal-QL 在离线成功轨迹上初始化。(第 3.1 节、算法 1;Nakamoto et al., 2024)
  • JSRL 的 guide-policy roll-in 用来对照“只使用策略先验”的初始化分布设计。(附录 B.1;Uchendu et al., 2023)

不能从论文推出什么

  • 没有证明系统能从零能力、零成功样本开始学习。
  • 没有证明在开放世界、有人环境或未知物体上安全。
  • “不需额外人类示范”发生在已有基础模型和任务初始化之后;真机实验先用了 200 条遥操作轨迹微调基础模型。
  • 未见任务迁移并非全面胜过人类数据;长时程迁移仍落后于人类示范。
  • 真机样本量有限,30/30 不等于真实成功率必然是 100%。

来源核对

自测问题

  1. 为什么只收集一个完美 RL 专家的轨迹,反而可能教不好原来的通才模型?
  2. TbaseT_{base} 变大时,混合轨迹中的哪一部分会变长?这为何更容易出现恢复场景?
  3. 残差动作等于零时,机器人会执行谁的动作?
  4. 真机方块试验中的 30/30,为什么不能解释成任意真机任务都达到 100%?
  5. PLD 的最终部署为何不需要保留所有任务专家?

关于这篇论文的三个关键问题

PLD:机器人基础模型怎样主动找到失败区域,再把修正经验学回自己? 解决了什么问题?

机器人基础模型通常先看图像和文字指令,再输出机械臂动作。PLD 关心的不是重新造一个更大的模型,而是让已有模型亲自暴露容易失败的状态,借一个轻量“纠偏器”练出恢复动作,最后把这些经验教回原模型。

PLD:机器人基础模型怎样主动找到失败区域,再把修正经验学回自己? 的核心结论有哪些证据?

LIBERO 上,$\pi0$ 的平均成功率从 93.4% 升到 97.2%,OpenVLA 从 91.8% 升到 99.2%。SimplerEnv 的四任务平均值从 71.8% 升到 96.6%;单项最大绝对增幅是“夹取胡萝卜”的 50.6 个百分点。图中使用论文表 1、表 2 的原始数值;每项测试预算相同,LIBERO 每个任务评估 50 次。(论文第 4.1、4.2 节)

阅读 PLD:机器人基础模型怎样主动找到失败区域,再把修正经验学回自己? 时最需要注意什么局限?

“成功筛选”很关键,也带来限制:数据告诉模型哪些恢复奏效,却没有直接教安全约束。作者把安全受限的数据收集列为未来工作;当前结果不能推出无人看守的开放环境部署已经安全。(论文第 6 节)

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro