Robotics / Humanoid
OmniH2O从头和双手的轨迹,补出人形机器人的全身动作
官方标题:OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning
论文:arXiv:2406.08858|作者:Tairan He 等|提交日期:2024-06-13
这项工作问的不是“机器人能不能照着人摆姿势”,而是更难的一步:当普通 VR 设备只告诉机器人头和双手在哪里时,机器人能否自己决定腰、腿和脚怎样配合,既跟上动作,又不摔倒?
先给机器人看“它真的做得到”的全身动作
训练信号先来自 AMASS 人体动作库。系统把人的全身动作重新映射到机器人身体,并滤掉 H1 做不到的姿势;它还额外制造“上身活动、下身固定站立或下蹲”的版本。要注意的关系是:机器人不是直接模仿原始人体骨架,而是从一批经过身体尺寸和稳定性约束的目标动作中学习。(论文第 3 节,图 1–2)
这种数据偏置专门处理一个实机问题:旧方法 H2O 即使该站着,也容易用碎步找平衡。它帮助策略学会何时不动脚,但也意味着训练分布是人为设计的,并不能保证覆盖所有人体动作或所有失衡情况。
三个亮点给方向,教师用完整答案带学生练习
部署时,学生策略只接收头和双手这 3 个目标点,以及机器人自身传感器的近期记录;训练时,教师策略在仿真里能看到每个身体部件的位置、方向和速度。学生先按自己的判断行动,教师再针对学生实际走到的状态给出更好的关节目标。这就是 DAgger 在本文里的具体作用:让学生练自己会犯错的路段,而不只背诵教师走过的标准路线。(论文第 3 节“Teacher”“Student”“Policy Distillation”)
这里唯一需要保留的核心公式回答:“学生的动作要怎样靠近教师?”
输入是教师给出的关节目标 和学生给出的关节目标 。两者逐项相减、各自平方,再加总,得到损失 。例如两个关节分别差 和 ,损失对应 ;若误差都减半,损失会变成原来的四分之一。训练会压低这个数,因此大错误受到更强惩罚;但公式只要求学生模仿教师,并不单独证明教师动作在真实世界一定安全。(论文公式,策略蒸馏段)
25 步身体记忆,替代一项实机难测的速度
真实 H1 很难稳定获得“整台机器人相对世界移动多快”。OmniH2O 不把这项全局线速度塞给学生,而是给它最近 25 步的关节角、关节速度、躯干转动、重力方向和上一批动作。就像只看几帧连续照片也能判断人在向前还是向后,这段历史让策略从变化中推断运动趋势;输出仍是下一步关节目标,再由 PD 控制器驱动电机。(论文第 3 节;第 4.1 节)
这不是给仿真策略加一个“实机修正量”,而是从训练时就限制学生只能使用实机可获得的信号,并在仿真中随机改变物理条件来增强耐受性。实机消融支持这一选择:无历史版本的全局关节位置误差为 83.26 mm,25 步版本为 47.94 mm;使用 VIO 估计线速度的版本甚至无法完成测试,因为机器人跌倒。测试只有 20 段站立动作,因此这组证据主要说明站立跟踪更稳,不等于各种走动和操作都已被同样严格地量化。(论文表 2)
94.10% 是仿真覆盖率,实机演示说明“能做”,不是“总能做”
在 1.4 万段仿真动作上,OmniH2O 的成功率是 94.10%,高于 H2O 的 87.52%,接近拥有仿真特权信息的教师策略 94.77%;但只追踪 3 个点会牺牲姿态精度:全局 MPJPE 为 141.11 mm,而 22 点输入为 127.71 mm。这里的成功指动作过程中平均偏离参考没有超过论文设定的 0.5 m 失败线,不代表每个关节都精确。(论文第 4.1 节,表 1)
实机部分展示了 VR、RGB、语言动作生成器、户外地面和受扰动站立,也用遥操作数据训练四项自主任务。每项只有 10 次成功率试验;完整数据下,蹲避与石头剪刀布达到 10/10,接放盒子与接锤子为 6/10。最稳妥的结论是:同一套全身跟踪策略能接多种上游指令,并在 H1 上完成多类演示;论文没有给出大规模、长时间、跨机器人或开放环境的可靠性保证。(论文第 4.2–4.3 节,表 17)
研究附录
一句话机制
OmniH2O 把各种控制来源先统一成“目标身体点的位置”,再由一个从特权教师蒸馏而来的学生策略,把稀疏目标与自身历史转换成全身关节目标。
证据账本
| 问题 | 论文证据 | 可支持的说法 | 不能推出 |
|---|---|---|---|
| 稀疏输入能否跟踪大批动作? | 14k 段仿真动作;3 点成功率 94.10%,22 点 94.72% | 3 点输入的仿真成功覆盖率接近密集输入 | 3 点与 22 点精度相同;任意动作都成功 |
| 是否优于 H2O? | 表 1:H2O 87.52%,OmniH2O 94.10% | 在论文的仿真数据与指标下成功率更高 | 对所有机器人和场景普遍更优 |
| 历史是否帮助实机? | 表 2:0 步全局 MPJPE 83.26 mm;25 步 47.94 mm | 在 20 段站立动作中,25 步历史明显降低误差 | 已证明动态走动、搬运也有同样幅度提升 |
| 自主技能是否学成? | 每项 10 次;完整数据下 6/10、10/10、6/10、10/10 | 四项任务都出现成功,两个任务在该小样本中全成 | 高置信度的真实成功率或长期稳定性 |
关键表示与动作链
论文把运动学姿态写成
它回答“某一时刻的全身目标要记录什么”: 是各关节的三维旋转, 是各关节的三维位置,合在一起得到完整姿态 。VR 部署只直接提供头与双手的位置子集,而不是完整 。
学生的实机目标状态是
它回答“策略怎样知道三个亮点该往哪追”:波浪号表示控制来源给出的目标,普通符号表示机器人当前值;前两项是位置差和速度差,最后一项保留目标位置。差为零意味着对应点已经追上;差越大,策略越需要用全身协调来缩小偏差。这里的 “real” 只包含头和双手 3 点。
策略输出 是目标关节角。低层 PD 控制器再根据目标角与当前角的偏差产生电机作用;灵巧手则由 VR 手势通过逆运动学计算关节目标,是一条独立的低层控制支路。
为什么教师比学生知道得多
教师在仿真中可见所有刚体的位置、方向、线速度、角速度和上一动作,还可看到完整参考姿态及其与当前状态的差。学生只获得实机传感器能稳定给出的信息。这样的不对称训练把“找答案”和“上机器”分开:教师利用完整信息学会协调,学生学习复现教师动作。
DAgger 每轮让学生先运行,再在学生访问到的状态上询问教师。这样收集的训练样本包含学生自己的偏离状态。若只在教师的理想轨迹上训练,学生部署时一旦走偏,可能从未见过如何回到正轨。
数据、奖励与随机化
训练动作来自重定向后的 AMASS,并加入固定下肢的站立与下蹲变体。奖励同时包含动作模仿与动作规整;论文特别加入“每一步最大抬脚高度”奖励,并用课程式权重避免机器人用跺脚维持平衡。仿真训练还随机化物理参数,以减小模型与真实 H1 的差距。
这些设计共同出现,消融并未把每一项在所有真实任务中的独立贡献完全拆开。因此更准确的说法是“整套配方得到论文展示的效果”,而不是某一个奖励单独造成所有提升。
主要数值比较
| 设置 | 成功率 ↑ | 全局 MPJPE ↓ | 局部 MPJPE ↓ | 备注 |
|---|---|---|---|---|
| 特权教师 | 94.77% | 126.51 mm | 70.68 mm | 不可直接实机部署 |
| H2O | 87.52% | 148.13 mm | 81.06 mm | 需要全局速度 / MoCap |
| OmniH2O,3 点 | 94.10% | 141.11 mm | 77.82 mm | 可部署学生 |
| OmniH2O,22 点 | 94.72% | 127.71 mm | 70.39 mm | 输入更密集 |
数值来自论文表 1 的“全部序列”。成功率越高越好,误差越低越好。3 点版本更便于接入消费级 VR,但姿态位置误差高于 22 点版本,这是可用性与精度的交换。
OmniH2O-6 与自主控制
数据集含六项日常任务,并配对第一人称 RGBD、控制输入和全身电机动作:Catch-Release 13,234 帧、Squat 8,535 帧、Hammer-Catch 12,759 帧、Rock-Paper-Scissors 9,380 帧、Boxing 11,118 帧、Basket-Pick-Place 18,436 帧。论文定量评估其中四项。
GPT-4o 路线并非让模型直接连续控制关节。头部相机图像交给模型,模型从预先给定的动作原语中选择;这样绕开了模型响应较慢的问题。另一条路线则用遥操作数据训练模仿学习策略。
与前作的关系
- H2O 提供了基于强化学习的人到人形机器人全身遥操作框架;OmniH2O 延伸它,移除部署时对 MoCap / 全局线速度的依赖,并把目标压缩到头和双手。
- AMASS 提供大规模人体动作来源;本文将其重定向、过滤,并加入稳定站立与下蹲变体。
- DAgger 提供“学生先走、教师在学生状态上标答案”的数据聚合训练框架;本文用它完成特权教师到可部署学生的蒸馏。
术语
- 重定向(retargeting):把人的动作按机器人骨架、关节范围和身体比例改写。
- 特权信息:仿真里能准确读取、真实机器人上却难以可靠测得的状态。
- 蒸馏:让信息较少的学生模仿信息较多的教师输出。
- 本体感觉:机器人由关节编码器和惯性传感器感知自身姿态与运动。
- MPJPE:各关节位置误差的平均值;数值越小,位置跟踪越准。
- sim-to-real:在仿真中训练,再把策略部署到真实硬件。
限制与不确定性
- 真实世界的定量动作跟踪只覆盖 20 段站立动作,受实验空间限制。
- 自主任务每种只测试 10 次,样本不足以给出窄置信区间。
- 3 点输入存在天然歧义:同样的头手位置可能对应不同腿部姿态;论文也指出增加关键点可缓解。
- 实机演示丰富,但许多能力主要由视频与案例展示,没有统一的大规模成功率测试。
- 结果基于特定全尺寸 H1 系统,论文没有证明无需重新训练即可迁移到其他人形机器人。
来源定位
- 标题、摘要与贡献:arXiv 摘要页;正文摘要与第 1 节。
- 动作重定向、稳定动作增强、教师—学生、25 步历史、蒸馏损失:正文第 3 节,图 1–2。
- 仿真与实机跟踪:正文第 4.1 节,表 1–2。
- 多接口、鲁棒性演示:正文第 4.2 节,图 3–4。
- 自主控制、数据规模与成功率:正文第 4.3 节,表 17。
验证问题
- 为什么只给头和双手的位置,策略仍可能推断腿该怎么动?
- 教师在训练时多看到了哪些信息?学生部署时为什么不能依赖它们?
- 蒸馏损失变为原来的四分之一,动作误差大致发生了什么变化?
- 94.10% 成功率来自仿真还是实机?它采用什么失败线?
- 哪些结果支持“能在 H1 上运行”,哪些结果还不足以支持“长期可靠”?
关于这篇论文的三个关键问题
OmniH2O:从头和双手的轨迹,补出人形机器人的全身动作 解决了什么问题?
这项工作问的不是“机器人能不能照着人摆姿势”,而是更难的一步:当普通 VR 设备只告诉机器人头和双手在哪里时,机器人能否自己决定腰、腿和脚怎样配合,既跟上动作,又不摔倒?
OmniH2O:从头和双手的轨迹,补出人形机器人的全身动作 的核心结论有哪些证据?
在 1.4 万段仿真动作上,OmniH2O 的成功率是 94.10%,高于 H2O 的 87.52%,接近拥有仿真特权信息的教师策略 94.77%;但只追踪 3 个点会牺牲姿态精度:全局 MPJPE 为 141.11 mm,而 22 点输入为 127.71 mm。这里的成功指动作过程中平均偏离参考没有超过论文设定的 0.5 m 失败线,不代表每个关节都精确。(论文第 4.1 节,表 1)
阅读 OmniH2O:从头和双手的轨迹,补出人形机器人的全身动作 时最需要注意什么局限?
这项工作问的不是“机器人能不能照着人摆姿势”,而是更难的一步:当普通 VR 设备只告诉机器人头和双手在哪里时,机器人能否自己决定腰、腿和脚怎样配合,既跟上动作,又不摔倒?