返回报告库

Robotics / Humanoid

HOVER面向人形机器人的多功能神经全身控制器

官方英文标题:HOVER: Versatile Neural Whole-Body Controller for Humanoid Robots
Tairan He 等,ICRA 2025;arXiv:2410.21229,本文依据 2025-03-06 的 v2。

人形机器人走路、挥手和双手操作时,常常要换一套“控制语言”。HOVER 的核心做法不是把许多控制器绑在一起,而是先让一位掌握完整人体动作的“老师”教出共同的身体本领,再用开关式指令让同一个学生控制器只听当前需要的身体信号。

人的动作先被翻译成 H1 能练习的姿势

先看训练信号从哪里来。作者从 AMASS 人体动作库取动作,用人体模型与机器人关键点对齐,把人的骨架姿势改写成宇树 H1 的关节和身体位置;随后再筛掉机器人做不到的动作。得到的不是“视频画面”,而是一串随时间变化、且对 H1 可行的全身目标姿势。论文把这套处理称为 motion retargeting 和 “sim-to-data”。【论文第 II-C 节,p.2】

这一步给后面的老师控制器提供了丰富动作,但不保证每个人类动作都能原样保留。人体和 H1 的比例、关节范围不同;筛选也意味着训练集代表的是“可迁移到这台机器人上的 AMASS 动作”,不是人类动作的全部。

一套指令面板,把不同控制方式变成可开关的格子

HOVER 把命令拆成三类:身体关键点的三维位置、各电机的局部关节角,以及身体根部的速度、高度与朝向;上半身和下半身还能分别选择。一个二值掩码像配电箱开关:亮起的格子必须追踪,关闭的格子不作为当前命令。这样,“只跟手”“上身跟关节、下身听行走速度”等原本分开的接口,都变成同一张面板的不同开关组合。【论文第 II-B、II-E 节,图 1–2,表 I】

训练时,每个模式开关和稀疏开关都以 0.5 概率取开或关,并在一段仿真任务中保持不变。这个随机过程让学生反复见到不同命令缺失或组合的情况。它支持任意子集的设计目标,但论文没有证明所有可能组合都同样好,也没有自动决定现实任务该开哪些格子。【论文第 II-E 节,p.3;结论,p.5】

学生自己走偏时,老师就在它实际到达的位置纠正

老师先在仿真中看完整的全身目标和更丰富的机器人状态,学会模仿动作;学生只能看真机较容易获得的关节、机身角速度、重力方向和过去 25 步动作,再接收被掩码裁过的命令。学生自己在仿真里行动,老师针对学生实际走到的每个状态给出参考动作,学生据此改正。这就是论文采用 DAgger 的关键:练习的不只是老师从不犯错的路线,也包括学生自己造成的偏差。【论文第 II-D–II-E 节,图 2】

这里唯一需要保留的核心式子回答:“学生这一步和老师差多远?”

L=a^tat22\mathcal{L}=\lVert \hat{a}_t-a_t\rVert_2^2

输入是老师给出的 19 个目标关节位置 a^t\hat a_t 与学生给出的 ata_t。先逐项相减,再把差值平方并相加,输出一个非负误差。比如两项动作分别差 112-2,误差就是 12+(2)2=51^2+(-2)^2=5;大偏差会因平方受到更强惩罚。误差降到 0,表示这一步动作与老师相同;误差升高,训练会更用力地修改学生。这个式子只让学生模仿老师,并不保证老师本身对每个现实任务都是最优。【论文式 (II-E),p.3】

随机化把策略送上真机,但证据只覆盖有限试验

为减小仿真和真机的差距,作者在训练老师时随机改变仿真环境与机器人物理参数;学生又只使用真机可获得的观测。最后,同一策略部署到约 1.8 米、51.5 千克、19 自由度的 Unitree H1。论文在 20 段站立动作上定量比较:HOVER 在 12 个“模式 × 指标”结果中的 11 个优于对应专家;例如 ExBody 模式的全局身体位置误差从 51.3 mm 降到 48.9 mm。【论文第 II-D、III-C 节,表 V】

另外,作者展示了走路时突然切换模式、动态跑步和 Vision Pro 遥操作时随机遮掉头手目标的真机演示。它们说明这些行为在展示条件下能够运行,却不是大规模成功率测试。20 段定量动作都是站立动作;论文也未报告长时运行、外力干扰、复杂地形或自动选模式的系统评估,自动模式切换仍被列为未来工作。【论文第 III-C 节,图 5–6;结论】

研究附录

一句话还原方法

AMASS 人体动作先重定向并筛成 H1 可行轨迹;全信息老师用强化学习学全身模仿;命令掩码把不同接口改写为同一向量的子集;学生在自己的仿真轨迹上查询老师动作并用监督损失模仿;域随机化与可测观测帮助部署到真机。

统一命令空间

控制区域命令类型具体输入直观用途
上半身 / 下半身运动学位置选定刚体关键点的 3D 目标位置跟随头、手、肘、脚踝等空间位置
上半身 / 下半身局部关节角各电机目标角度精确指定身体姿态
根部根部追踪速度、高度、滚转/俯仰/偏航走向、站高和身体朝向

论文表 I 将 ExBody、H2O、OmniH2O、HumanPlus 与 MHC 的接口写成这套命令空间的子集;HOVER 是表中唯一覆盖六个命令栏且支持多模式控制的方法。这里的“覆盖”指接口表达能力,不等于每种任务性能都已验证。

两种掩码究竟做什么

模式掩码 MmodeM_{\text{mode}} 先选命令类别,例如上半身选关键点位置、下半身选根部追踪。稀疏掩码 MsparsityM_{\text{sparsity}} 再从已选类别中挑具体部位,例如只留下双手。二值位来自 B(0.5)\mathcal{B}(0.5):可把它理解为每个开关独立抛一次均匀硬币,正面开、反面关。概率增大时,学生更常看到信息充足的命令;概率减小时,更常练习信息缺失的命令。论文固定使用 0.5,没有给出这个概率的系统消融。

状态、动作与训练目标

老师策略写作 πoracle(atstp-oracle,stg-oracle)\pi_{\text{oracle}}(a_t\mid s_t^{p\text{-oracle}},s_t^{g\text{-oracle}})。它看到所有刚体的位置、朝向、线速度、角速度、上一动作,以及参考全身姿势和当前姿势的差。学生策略 πstudent\pi_{\text{student}} 使用关节位置 qq、关节速度 q˙\dot q、基座角速度 ωbase\omega_{\text{base}}、重力向量 gg 和动作历史;论文堆叠最近 25 步。

两者输出的 atR19a_t\in\mathbb{R}^{19} 是 19 个目标关节位置,随后交给 PD 控制器驱动电机。训练学生时最小化

L=a^tat22=i=119(a^t,iat,i)2.\mathcal{L}=\lVert \hat{a}_t-a_t\rVert_2^2 =\sum_{i=1}^{19}(\hat a_{t,i}-a_{t,i})^2 .

右侧展开式说明“二范数平方”就是 19 个关节误差的平方和。它对正负偏差一视同仁;单个关节误差翻倍,该关节对损失的贡献会变成四倍。论文没有在损失中给不同关节不同权重。

仿真结果:哪些数字最能支撑“蒸馏有效”

对比论文报告的结果能支持什么
HOVER 对四个既有专家模式每种模式 12 项指标中至少 7 项更优同一通用策略没有因统一接口而普遍输给单模式策略
HOVER 对从头训练的 Multi-Mode RL8 模式 × 4 指标,共 32/32 个追踪误差更低改善不只来自相同掩码;全身老师蒸馏是关键差别
额外的左手、右手、双手、头部模式论文表 IV 报告各模式的被追踪指标掩码可组成训练时考虑的更多接口

这些结果来自 IsaacGym 和重定向后的 Q^\hat Q 数据集。论文把共享平衡与身体知识视为通用策略胜出的可能原因,但明确写作假设;实验没有单独测量“共享知识”本身。

真机表 V 的完整核心数字

数值越低越好;位置误差单位为 mm,关节与根部朝向误差单位为 rad。均值后的 ± 来自 5 次测试,表中 20 段动作均为站立动作。

模式方法全局位置根部相对位置上身关节根部朝向
ExBody专家51.3 ± 0.27939.3 ± 0.2140.131 ± 0.0010.036 ± 0.001
ExBodyHOVER48.9 ± 0.47036.8 ± 0.2010.126 ± 0.0010.032 ± 0.001
HumanPlus专家51.0 ± 0.27536.7 ± 0.2020.128 ± 0.0010.035 ± 0.001
HumanPlusHOVER47.4 ± 0.35935.3 ± 0.1940.121 ± 0.0010.038 ± 0.001
OmniH2O专家51.2 ± 0.49742.1 ± 0.2330.153 ± 0.0020.040 ± 0.001
OmniH2OHOVER47.5 ± 0.26141.0 ± 0.2270.145 ± 0.0010.037 ± 0.001

唯一没有改善的是 HumanPlus 的根部朝向误差:0.035 增至 0.038 rad。因此“11/12 更好”比“全面更好”准确。

明确边界与尚未回答的问题

  • 论文声称支持超过 15 种有用模式,但主要定量表只覆盖其中一部分。
  • 真机的定量比较限于 20 段站立动作;行走、转身、后退、动态跑步和遮挡遥操作主要是定性展示。
  • 论文没有给出跌倒率、长时稳定性、能耗、延迟、外力恢复、复杂地形或不同 H1 个体之间迁移的完整真机统计。
  • 模式由外部掩码指定;自动识别任务并切换模式仍是未来工作。
  • HOVER 输出目标关节位置,再由 PD 控制器执行;它不是直接输出电机扭矩的端到端控制器。

与前序工作的关系

  • OmniH2O(arXiv:2406.08858):HOVER 沿用其三层 MLP 结构、域随机化和 25 步学生观测堆叠,并把其头手关键点模式纳入统一命令空间。
  • H2O(arXiv:2403.04436):HOVER 沿用其动作重定向与 “sim-to-data” 流程,并覆盖其八关键点遥操作接口。
  • ExBody(arXiv:2402.16796):其上身关节角 + 下身根部命令成为 HOVER 的一种掩码配置与专家基线。
  • HumanPlus(arXiv:2406.10454):其全身关节 + 根部命令成为 HOVER 的一种掩码配置与专家基线。
  • DAgger(Ross 等,2011):HOVER 采用其“在学生访问到的状态上向老师询问动作”的数据聚合式模仿学习框架。

术语小抄

  • 根部(root):机器人身体的整体参考位置与朝向,常可理解为躯干/骨盆的基准。
  • 运动学关键点:头、手、肘、脚踝等刚体在三维空间中的位置。
  • 本体感知:机器人从自身传感器读到的关节、机身转动和重力方向等状态。
  • 策略蒸馏:让较受限的学生策略模仿信息更充分的老师策略。
  • 域随机化:训练时反复改变仿真物理参数,让策略少依赖某一套精确仿真条件。
  • PD 控制器:根据目标位置与当前误差产生底层电机控制的经典反馈模块。

来源核对与验证问题

主要来源为论文 v2:标题与摘要;第 II-B–II-E 节;图 1–2;表 I–II;第 III 节、图 3–6、表 III–V;第 IV 节与参考文献 [9]、[10]、[12]、[13]、[17]、[22];结论。读者可继续追问:

  1. 把掩码概率从 0.5 改掉,哪些模式受益、哪些退化?
  2. 若老师动作在现实硬件上并不理想,学生会不会忠实继承问题?
  3. 走路中连续切换模式的成功率、跌倒率和最长运行时间是多少?
  4. 是否能用任务或视觉输入自动产生掩码,而不再由人指定?
  5. 在不同身材、自由度或执行器的人形机器人上,哪些部分必须重训?

关于这篇论文的三个关键问题

HOVER:面向人形机器人的多功能神经全身控制器 解决了什么问题?

人形机器人走路、挥手和双手操作时,常常要换一套“控制语言”。HOVER 的核心做法不是把许多控制器绑在一起,而是先让一位掌握完整人体动作的“老师”教出共同的身体本领,再用开关式指令让同一个学生控制器只听当前需要的身体信号。

HOVER:面向人形机器人的多功能神经全身控制器 的核心结论有哪些证据?

另外,作者展示了走路时突然切换模式、动态跑步和 Vision Pro 遥操作时随机遮掉头手目标的真机演示。它们说明这些行为在展示条件下能够运行,却不是大规模成功率测试。20 段定量动作都是站立动作;论文也未报告长时运行、外力干扰、复杂地形或自动选模式的系统评估,自动模式切换仍被列为未来工作。【论文第 III-C 节,图 5–6;结论】

阅读 HOVER:面向人形机器人的多功能神经全身控制器 时最需要注意什么局限?

老师先在仿真中看完整的全身目标和更丰富的机器人状态,学会模仿动作;学生只能看真机较容易获得的关节、机身角速度、重力方向和过去 25 步动作,再接收被掩码裁过的命令。学生自己在仿真里行动,老师针对学生实际走到的每个状态给出参考动作,学生据此改正。这就是论文采用 DAgger 的关键:练习的不只是老师从不犯错的路线,也包括学生自己造成的偏差。【论文第 II-D–II-E 节,图 2】

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro