返回报告库

Robotics / NVIDIA

PLD机器人基础模型怎样主动找到失败区域,再把修正经验学回自己?

关于这篇论文的三个关键问题

PLD:机器人基础模型怎样主动找到失败区域,再把修正经验学回自己? 解决了什么问题?

机器人基础模型通常先看图像和文字指令,再输出机械臂动作。PLD 关心的不是重新造一个更大的模型,而是让已有模型亲自暴露容易失败的状态,借一个轻量“纠偏器”练出恢复动作,最后把这些经验教回原模型。

PLD:机器人基础模型怎样主动找到失败区域,再把修正经验学回自己? 的核心结论有哪些证据?

LIBERO 上,$\pi0$ 的平均成功率从 93.4% 升到 97.2%,OpenVLA 从 91.8% 升到 99.2%。SimplerEnv 的四任务平均值从 71.8% 升到 96.6%;单项最大绝对增幅是“夹取胡萝卜”的 50.6 个百分点。图中使用论文表 1、表 2 的原始数值;每项测试预算相同,LIBERO 每个任务评估 50 次。(论文第 4.1、4.2 节)

阅读 PLD:机器人基础模型怎样主动找到失败区域,再把修正经验学回自己? 时最需要注意什么局限?

“成功筛选”很关键,也带来限制:数据告诉模型哪些恢复奏效,却没有直接教安全约束。作者把安全受限的数据收集列为未来工作;当前结果不能推出无人看守的开放环境部署已经安全。(论文第 6 节)

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro