返回报告库

Robotics / Humanoid

OmniH2O从头和双手的轨迹,补出人形机器人的全身动作

官方标题:OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning
论文:arXiv:2406.08858|作者:Tairan He 等|提交日期:2024-06-13

这项工作问的不是“机器人能不能照着人摆姿势”,而是更难的一步:当普通 VR 设备只告诉机器人头和双手在哪里时,机器人能否自己决定腰、腿和脚怎样配合,既跟上动作,又不摔倒?

先给机器人看“它真的做得到”的全身动作

训练信号先来自 AMASS 人体动作库。系统把人的全身动作重新映射到机器人身体,并滤掉 H1 做不到的姿势;它还额外制造“上身活动、下身固定站立或下蹲”的版本。要注意的关系是:机器人不是直接模仿原始人体骨架,而是从一批经过身体尺寸和稳定性约束的目标动作中学习。(论文第 3 节,图 1–2)

这种数据偏置专门处理一个实机问题:旧方法 H2O 即使该站着,也容易用碎步找平衡。它帮助策略学会何时不动脚,但也意味着训练分布是人为设计的,并不能保证覆盖所有人体动作或所有失衡情况。

三个亮点给方向,教师用完整答案带学生练习

部署时,学生策略只接收头和双手这 3 个目标点,以及机器人自身传感器的近期记录;训练时,教师策略在仿真里能看到每个身体部件的位置、方向和速度。学生先按自己的判断行动,教师再针对学生实际走到的状态给出更好的关节目标。这就是 DAgger 在本文里的具体作用:让学生练自己会犯错的路段,而不只背诵教师走过的标准路线。(论文第 3 节“Teacher”“Student”“Policy Distillation”)

这里唯一需要保留的核心公式回答:“学生的动作要怎样靠近教师?”

L=atprivilegedat22\mathcal{L}=\|{\bm{a}_{t}}^{\text{privileged}}-{\bm{a}_{t}}\|^{2}_{2}

输入是教师给出的关节目标 atprivileged{\bm{a}_{t}}^{\text{privileged}} 和学生给出的关节目标 at{\bm{a}_{t}}。两者逐项相减、各自平方,再加总,得到损失 L\mathcal{L}。例如两个关节分别差 22^\circ11^\circ,损失对应 22+12=52^2+1^2=5;若误差都减半,损失会变成原来的四分之一。训练会压低这个数,因此大错误受到更强惩罚;但公式只要求学生模仿教师,并不单独证明教师动作在真实世界一定安全。(论文公式,策略蒸馏段)

25 步身体记忆,替代一项实机难测的速度

真实 H1 很难稳定获得“整台机器人相对世界移动多快”。OmniH2O 不把这项全局线速度塞给学生,而是给它最近 25 步的关节角、关节速度、躯干转动、重力方向和上一批动作。就像只看几帧连续照片也能判断人在向前还是向后,这段历史让策略从变化中推断运动趋势;输出仍是下一步关节目标,再由 PD 控制器驱动电机。(论文第 3 节;第 4.1 节)

这不是给仿真策略加一个“实机修正量”,而是从训练时就限制学生只能使用实机可获得的信号,并在仿真中随机改变物理条件来增强耐受性。实机消融支持这一选择:无历史版本的全局关节位置误差为 83.26 mm,25 步版本为 47.94 mm;使用 VIO 估计线速度的版本甚至无法完成测试,因为机器人跌倒。测试只有 20 段站立动作,因此这组证据主要说明站立跟踪更稳,不等于各种走动和操作都已被同样严格地量化。(论文表 2)

94.10% 是仿真覆盖率,实机演示说明“能做”,不是“总能做”

在 1.4 万段仿真动作上,OmniH2O 的成功率是 94.10%,高于 H2O 的 87.52%,接近拥有仿真特权信息的教师策略 94.77%;但只追踪 3 个点会牺牲姿态精度:全局 MPJPE 为 141.11 mm,而 22 点输入为 127.71 mm。这里的成功指动作过程中平均偏离参考没有超过论文设定的 0.5 m 失败线,不代表每个关节都精确。(论文第 4.1 节,表 1)

实机部分展示了 VR、RGB、语言动作生成器、户外地面和受扰动站立,也用遥操作数据训练四项自主任务。每项只有 10 次成功率试验;完整数据下,蹲避与石头剪刀布达到 10/10,接放盒子与接锤子为 6/10。最稳妥的结论是:同一套全身跟踪策略能接多种上游指令,并在 H1 上完成多类演示;论文没有给出大规模、长时间、跨机器人或开放环境的可靠性保证。(论文第 4.2–4.3 节,表 17)

研究附录

一句话机制

OmniH2O 把各种控制来源先统一成“目标身体点的位置”,再由一个从特权教师蒸馏而来的学生策略,把稀疏目标与自身历史转换成全身关节目标。

证据账本

问题论文证据可支持的说法不能推出
稀疏输入能否跟踪大批动作?14k 段仿真动作;3 点成功率 94.10%,22 点 94.72%3 点输入的仿真成功覆盖率接近密集输入3 点与 22 点精度相同;任意动作都成功
是否优于 H2O?表 1:H2O 87.52%,OmniH2O 94.10%在论文的仿真数据与指标下成功率更高对所有机器人和场景普遍更优
历史是否帮助实机?表 2:0 步全局 MPJPE 83.26 mm;25 步 47.94 mm在 20 段站立动作中,25 步历史明显降低误差已证明动态走动、搬运也有同样幅度提升
自主技能是否学成?每项 10 次;完整数据下 6/10、10/10、6/10、10/10四项任务都出现成功,两个任务在该小样本中全成高置信度的真实成功率或长期稳定性

关键表示与动作链

论文把运动学姿态写成

qt(θt,pt){\bm{{q}}_{t}}\triangleq({\bm{{\theta}}_{t}},{\bm{{p}}_{t}})

它回答“某一时刻的全身目标要记录什么”:θt{\bm{{\theta}}_{t}} 是各关节的三维旋转,pt{\bm{{p}}_{t}} 是各关节的三维位置,合在一起得到完整姿态 qt{\bm{{q}}_{t}}。VR 部署只直接提供头与双手的位置子集,而不是完整 qt{\bm{{q}}_{t}}

学生的实机目标状态是

stg-real(p~trealptreal,v~trealvtreal,p~treal){\bm{s}^{\text{g-real}}_{t}}\triangleq ({\bm{\tilde{p}}^{\text{real}}_{t}}-{\bm{{p}}_{t}^{\text{real}}}, {\bm{\tilde{v}}^{\text{real}}_{t}}-{\bm{v}^{\text{real}}_{t}}, {\bm{\tilde{p}}^{\text{real}}_{t}})

它回答“策略怎样知道三个亮点该往哪追”:波浪号表示控制来源给出的目标,普通符号表示机器人当前值;前两项是位置差和速度差,最后一项保留目标位置。差为零意味着对应点已经追上;差越大,策略越需要用全身协调来缩小偏差。这里的 “real” 只包含头和双手 3 点。

策略输出 at{\bm a}_t 是目标关节角。低层 PD 控制器再根据目标角与当前角的偏差产生电机作用;灵巧手则由 VR 手势通过逆运动学计算关节目标,是一条独立的低层控制支路。

为什么教师比学生知道得多

教师在仿真中可见所有刚体的位置、方向、线速度、角速度和上一动作,还可看到完整参考姿态及其与当前状态的差。学生只获得实机传感器能稳定给出的信息。这样的不对称训练把“找答案”和“上机器”分开:教师利用完整信息学会协调,学生学习复现教师动作。

DAgger 每轮让学生先运行,再在学生访问到的状态上询问教师。这样收集的训练样本包含学生自己的偏离状态。若只在教师的理想轨迹上训练,学生部署时一旦走偏,可能从未见过如何回到正轨。

数据、奖励与随机化

训练动作来自重定向后的 AMASS,并加入固定下肢的站立与下蹲变体。奖励同时包含动作模仿与动作规整;论文特别加入“每一步最大抬脚高度”奖励,并用课程式权重避免机器人用跺脚维持平衡。仿真训练还随机化物理参数,以减小模型与真实 H1 的差距。

这些设计共同出现,消融并未把每一项在所有真实任务中的独立贡献完全拆开。因此更准确的说法是“整套配方得到论文展示的效果”,而不是某一个奖励单独造成所有提升。

主要数值比较

设置成功率 ↑全局 MPJPE ↓局部 MPJPE ↓备注
特权教师94.77%126.51 mm70.68 mm不可直接实机部署
H2O87.52%148.13 mm81.06 mm需要全局速度 / MoCap
OmniH2O,3 点94.10%141.11 mm77.82 mm可部署学生
OmniH2O,22 点94.72%127.71 mm70.39 mm输入更密集

数值来自论文表 1 的“全部序列”。成功率越高越好,误差越低越好。3 点版本更便于接入消费级 VR,但姿态位置误差高于 22 点版本,这是可用性与精度的交换。

OmniH2O-6 与自主控制

数据集含六项日常任务,并配对第一人称 RGBD、控制输入和全身电机动作:Catch-Release 13,234 帧、Squat 8,535 帧、Hammer-Catch 12,759 帧、Rock-Paper-Scissors 9,380 帧、Boxing 11,118 帧、Basket-Pick-Place 18,436 帧。论文定量评估其中四项。

GPT-4o 路线并非让模型直接连续控制关节。头部相机图像交给模型,模型从预先给定的动作原语中选择;这样绕开了模型响应较慢的问题。另一条路线则用遥操作数据训练模仿学习策略。

与前作的关系

  • H2O 提供了基于强化学习的人到人形机器人全身遥操作框架;OmniH2O 延伸它,移除部署时对 MoCap / 全局线速度的依赖,并把目标压缩到头和双手。
  • AMASS 提供大规模人体动作来源;本文将其重定向、过滤,并加入稳定站立与下蹲变体。
  • DAgger 提供“学生先走、教师在学生状态上标答案”的数据聚合训练框架;本文用它完成特权教师到可部署学生的蒸馏。

术语

  • 重定向(retargeting):把人的动作按机器人骨架、关节范围和身体比例改写。
  • 特权信息:仿真里能准确读取、真实机器人上却难以可靠测得的状态。
  • 蒸馏:让信息较少的学生模仿信息较多的教师输出。
  • 本体感觉:机器人由关节编码器和惯性传感器感知自身姿态与运动。
  • MPJPE:各关节位置误差的平均值;数值越小,位置跟踪越准。
  • sim-to-real:在仿真中训练,再把策略部署到真实硬件。

限制与不确定性

  1. 真实世界的定量动作跟踪只覆盖 20 段站立动作,受实验空间限制。
  2. 自主任务每种只测试 10 次,样本不足以给出窄置信区间。
  3. 3 点输入存在天然歧义:同样的头手位置可能对应不同腿部姿态;论文也指出增加关键点可缓解。
  4. 实机演示丰富,但许多能力主要由视频与案例展示,没有统一的大规模成功率测试。
  5. 结果基于特定全尺寸 H1 系统,论文没有证明无需重新训练即可迁移到其他人形机器人。

来源定位

  • 标题、摘要与贡献:arXiv 摘要页;正文摘要与第 1 节。
  • 动作重定向、稳定动作增强、教师—学生、25 步历史、蒸馏损失:正文第 3 节,图 1–2。
  • 仿真与实机跟踪:正文第 4.1 节,表 1–2。
  • 多接口、鲁棒性演示:正文第 4.2 节,图 3–4。
  • 自主控制、数据规模与成功率:正文第 4.3 节,表 17。

验证问题

  1. 为什么只给头和双手的位置,策略仍可能推断腿该怎么动?
  2. 教师在训练时多看到了哪些信息?学生部署时为什么不能依赖它们?
  3. 蒸馏损失变为原来的四分之一,动作误差大致发生了什么变化?
  4. 94.10% 成功率来自仿真还是实机?它采用什么失败线?
  5. 哪些结果支持“能在 H1 上运行”,哪些结果还不足以支持“长期可靠”?

关于这篇论文的三个关键问题

OmniH2O:从头和双手的轨迹,补出人形机器人的全身动作 解决了什么问题?

这项工作问的不是“机器人能不能照着人摆姿势”,而是更难的一步:当普通 VR 设备只告诉机器人头和双手在哪里时,机器人能否自己决定腰、腿和脚怎样配合,既跟上动作,又不摔倒?

OmniH2O:从头和双手的轨迹,补出人形机器人的全身动作 的核心结论有哪些证据?

在 1.4 万段仿真动作上,OmniH2O 的成功率是 94.10%,高于 H2O 的 87.52%,接近拥有仿真特权信息的教师策略 94.77%;但只追踪 3 个点会牺牲姿态精度:全局 MPJPE 为 141.11 mm,而 22 点输入为 127.71 mm。这里的成功指动作过程中平均偏离参考没有超过论文设定的 0.5 m 失败线,不代表每个关节都精确。(论文第 4.1 节,表 1)

阅读 OmniH2O:从头和双手的轨迹,补出人形机器人的全身动作 时最需要注意什么局限?

这项工作问的不是“机器人能不能照着人摆姿势”,而是更难的一步:当普通 VR 设备只告诉机器人头和双手在哪里时,机器人能否自己决定腰、腿和脚怎样配合,既跟上动作,又不摔倒?

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro