Robotics / Humanoid
HOVER面向人形机器人的多功能神经全身控制器
官方英文标题:HOVER: Versatile Neural Whole-Body Controller for Humanoid Robots
Tairan He 等,ICRA 2025;arXiv:2410.21229,本文依据 2025-03-06 的 v2。
人形机器人走路、挥手和双手操作时,常常要换一套“控制语言”。HOVER 的核心做法不是把许多控制器绑在一起,而是先让一位掌握完整人体动作的“老师”教出共同的身体本领,再用开关式指令让同一个学生控制器只听当前需要的身体信号。
人的动作先被翻译成 H1 能练习的姿势
先看训练信号从哪里来。作者从 AMASS 人体动作库取动作,用人体模型与机器人关键点对齐,把人的骨架姿势改写成宇树 H1 的关节和身体位置;随后再筛掉机器人做不到的动作。得到的不是“视频画面”,而是一串随时间变化、且对 H1 可行的全身目标姿势。论文把这套处理称为 motion retargeting 和 “sim-to-data”。【论文第 II-C 节,p.2】
这一步给后面的老师控制器提供了丰富动作,但不保证每个人类动作都能原样保留。人体和 H1 的比例、关节范围不同;筛选也意味着训练集代表的是“可迁移到这台机器人上的 AMASS 动作”,不是人类动作的全部。
一套指令面板,把不同控制方式变成可开关的格子
HOVER 把命令拆成三类:身体关键点的三维位置、各电机的局部关节角,以及身体根部的速度、高度与朝向;上半身和下半身还能分别选择。一个二值掩码像配电箱开关:亮起的格子必须追踪,关闭的格子不作为当前命令。这样,“只跟手”“上身跟关节、下身听行走速度”等原本分开的接口,都变成同一张面板的不同开关组合。【论文第 II-B、II-E 节,图 1–2,表 I】
训练时,每个模式开关和稀疏开关都以 0.5 概率取开或关,并在一段仿真任务中保持不变。这个随机过程让学生反复见到不同命令缺失或组合的情况。它支持任意子集的设计目标,但论文没有证明所有可能组合都同样好,也没有自动决定现实任务该开哪些格子。【论文第 II-E 节,p.3;结论,p.5】
学生自己走偏时,老师就在它实际到达的位置纠正
老师先在仿真中看完整的全身目标和更丰富的机器人状态,学会模仿动作;学生只能看真机较容易获得的关节、机身角速度、重力方向和过去 25 步动作,再接收被掩码裁过的命令。学生自己在仿真里行动,老师针对学生实际走到的每个状态给出参考动作,学生据此改正。这就是论文采用 DAgger 的关键:练习的不只是老师从不犯错的路线,也包括学生自己造成的偏差。【论文第 II-D–II-E 节,图 2】
这里唯一需要保留的核心式子回答:“学生这一步和老师差多远?”
输入是老师给出的 19 个目标关节位置 与学生给出的 。先逐项相减,再把差值平方并相加,输出一个非负误差。比如两项动作分别差 和 ,误差就是 ;大偏差会因平方受到更强惩罚。误差降到 0,表示这一步动作与老师相同;误差升高,训练会更用力地修改学生。这个式子只让学生模仿老师,并不保证老师本身对每个现实任务都是最优。【论文式 (II-E),p.3】
随机化把策略送上真机,但证据只覆盖有限试验
为减小仿真和真机的差距,作者在训练老师时随机改变仿真环境与机器人物理参数;学生又只使用真机可获得的观测。最后,同一策略部署到约 1.8 米、51.5 千克、19 自由度的 Unitree H1。论文在 20 段站立动作上定量比较:HOVER 在 12 个“模式 × 指标”结果中的 11 个优于对应专家;例如 ExBody 模式的全局身体位置误差从 51.3 mm 降到 48.9 mm。【论文第 II-D、III-C 节,表 V】
另外,作者展示了走路时突然切换模式、动态跑步和 Vision Pro 遥操作时随机遮掉头手目标的真机演示。它们说明这些行为在展示条件下能够运行,却不是大规模成功率测试。20 段定量动作都是站立动作;论文也未报告长时运行、外力干扰、复杂地形或自动选模式的系统评估,自动模式切换仍被列为未来工作。【论文第 III-C 节,图 5–6;结论】
研究附录
一句话还原方法
AMASS 人体动作先重定向并筛成 H1 可行轨迹;全信息老师用强化学习学全身模仿;命令掩码把不同接口改写为同一向量的子集;学生在自己的仿真轨迹上查询老师动作并用监督损失模仿;域随机化与可测观测帮助部署到真机。
统一命令空间
| 控制区域 | 命令类型 | 具体输入 | 直观用途 |
|---|---|---|---|
| 上半身 / 下半身 | 运动学位置 | 选定刚体关键点的 3D 目标位置 | 跟随头、手、肘、脚踝等空间位置 |
| 上半身 / 下半身 | 局部关节角 | 各电机目标角度 | 精确指定身体姿态 |
| 根部 | 根部追踪 | 速度、高度、滚转/俯仰/偏航 | 走向、站高和身体朝向 |
论文表 I 将 ExBody、H2O、OmniH2O、HumanPlus 与 MHC 的接口写成这套命令空间的子集;HOVER 是表中唯一覆盖六个命令栏且支持多模式控制的方法。这里的“覆盖”指接口表达能力,不等于每种任务性能都已验证。
两种掩码究竟做什么
模式掩码 先选命令类别,例如上半身选关键点位置、下半身选根部追踪。稀疏掩码 再从已选类别中挑具体部位,例如只留下双手。二值位来自 :可把它理解为每个开关独立抛一次均匀硬币,正面开、反面关。概率增大时,学生更常看到信息充足的命令;概率减小时,更常练习信息缺失的命令。论文固定使用 0.5,没有给出这个概率的系统消融。
状态、动作与训练目标
老师策略写作 。它看到所有刚体的位置、朝向、线速度、角速度、上一动作,以及参考全身姿势和当前姿势的差。学生策略 使用关节位置 、关节速度 、基座角速度 、重力向量 和动作历史;论文堆叠最近 25 步。
两者输出的 是 19 个目标关节位置,随后交给 PD 控制器驱动电机。训练学生时最小化
右侧展开式说明“二范数平方”就是 19 个关节误差的平方和。它对正负偏差一视同仁;单个关节误差翻倍,该关节对损失的贡献会变成四倍。论文没有在损失中给不同关节不同权重。
仿真结果:哪些数字最能支撑“蒸馏有效”
| 对比 | 论文报告的结果 | 能支持什么 |
|---|---|---|
| HOVER 对四个既有专家模式 | 每种模式 12 项指标中至少 7 项更优 | 同一通用策略没有因统一接口而普遍输给单模式策略 |
| HOVER 对从头训练的 Multi-Mode RL | 8 模式 × 4 指标,共 32/32 个追踪误差更低 | 改善不只来自相同掩码;全身老师蒸馏是关键差别 |
| 额外的左手、右手、双手、头部模式 | 论文表 IV 报告各模式的被追踪指标 | 掩码可组成训练时考虑的更多接口 |
这些结果来自 IsaacGym 和重定向后的 数据集。论文把共享平衡与身体知识视为通用策略胜出的可能原因,但明确写作假设;实验没有单独测量“共享知识”本身。
真机表 V 的完整核心数字
数值越低越好;位置误差单位为 mm,关节与根部朝向误差单位为 rad。均值后的 ± 来自 5 次测试,表中 20 段动作均为站立动作。
| 模式 | 方法 | 全局位置 | 根部相对位置 | 上身关节 | 根部朝向 |
|---|---|---|---|---|---|
| ExBody | 专家 | 51.3 ± 0.279 | 39.3 ± 0.214 | 0.131 ± 0.001 | 0.036 ± 0.001 |
| ExBody | HOVER | 48.9 ± 0.470 | 36.8 ± 0.201 | 0.126 ± 0.001 | 0.032 ± 0.001 |
| HumanPlus | 专家 | 51.0 ± 0.275 | 36.7 ± 0.202 | 0.128 ± 0.001 | 0.035 ± 0.001 |
| HumanPlus | HOVER | 47.4 ± 0.359 | 35.3 ± 0.194 | 0.121 ± 0.001 | 0.038 ± 0.001 |
| OmniH2O | 专家 | 51.2 ± 0.497 | 42.1 ± 0.233 | 0.153 ± 0.002 | 0.040 ± 0.001 |
| OmniH2O | HOVER | 47.5 ± 0.261 | 41.0 ± 0.227 | 0.145 ± 0.001 | 0.037 ± 0.001 |
唯一没有改善的是 HumanPlus 的根部朝向误差:0.035 增至 0.038 rad。因此“11/12 更好”比“全面更好”准确。
明确边界与尚未回答的问题
- 论文声称支持超过 15 种有用模式,但主要定量表只覆盖其中一部分。
- 真机的定量比较限于 20 段站立动作;行走、转身、后退、动态跑步和遮挡遥操作主要是定性展示。
- 论文没有给出跌倒率、长时稳定性、能耗、延迟、外力恢复、复杂地形或不同 H1 个体之间迁移的完整真机统计。
- 模式由外部掩码指定;自动识别任务并切换模式仍是未来工作。
- HOVER 输出目标关节位置,再由 PD 控制器执行;它不是直接输出电机扭矩的端到端控制器。
与前序工作的关系
- OmniH2O(arXiv:2406.08858):HOVER 沿用其三层 MLP 结构、域随机化和 25 步学生观测堆叠,并把其头手关键点模式纳入统一命令空间。
- H2O(arXiv:2403.04436):HOVER 沿用其动作重定向与 “sim-to-data” 流程,并覆盖其八关键点遥操作接口。
- ExBody(arXiv:2402.16796):其上身关节角 + 下身根部命令成为 HOVER 的一种掩码配置与专家基线。
- HumanPlus(arXiv:2406.10454):其全身关节 + 根部命令成为 HOVER 的一种掩码配置与专家基线。
- DAgger(Ross 等,2011):HOVER 采用其“在学生访问到的状态上向老师询问动作”的数据聚合式模仿学习框架。
术语小抄
- 根部(root):机器人身体的整体参考位置与朝向,常可理解为躯干/骨盆的基准。
- 运动学关键点:头、手、肘、脚踝等刚体在三维空间中的位置。
- 本体感知:机器人从自身传感器读到的关节、机身转动和重力方向等状态。
- 策略蒸馏:让较受限的学生策略模仿信息更充分的老师策略。
- 域随机化:训练时反复改变仿真物理参数,让策略少依赖某一套精确仿真条件。
- PD 控制器:根据目标位置与当前误差产生底层电机控制的经典反馈模块。
来源核对与验证问题
主要来源为论文 v2:标题与摘要;第 II-B–II-E 节;图 1–2;表 I–II;第 III 节、图 3–6、表 III–V;第 IV 节与参考文献 [9]、[10]、[12]、[13]、[17]、[22];结论。读者可继续追问:
- 把掩码概率从 0.5 改掉,哪些模式受益、哪些退化?
- 若老师动作在现实硬件上并不理想,学生会不会忠实继承问题?
- 走路中连续切换模式的成功率、跌倒率和最长运行时间是多少?
- 是否能用任务或视觉输入自动产生掩码,而不再由人指定?
- 在不同身材、自由度或执行器的人形机器人上,哪些部分必须重训?
关于这篇论文的三个关键问题
HOVER:面向人形机器人的多功能神经全身控制器 解决了什么问题?
人形机器人走路、挥手和双手操作时,常常要换一套“控制语言”。HOVER 的核心做法不是把许多控制器绑在一起,而是先让一位掌握完整人体动作的“老师”教出共同的身体本领,再用开关式指令让同一个学生控制器只听当前需要的身体信号。
HOVER:面向人形机器人的多功能神经全身控制器 的核心结论有哪些证据?
另外,作者展示了走路时突然切换模式、动态跑步和 Vision Pro 遥操作时随机遮掉头手目标的真机演示。它们说明这些行为在展示条件下能够运行,却不是大规模成功率测试。20 段定量动作都是站立动作;论文也未报告长时运行、外力干扰、复杂地形或自动选模式的系统评估,自动模式切换仍被列为未来工作。【论文第 III-C 节,图 5–6;结论】
阅读 HOVER:面向人形机器人的多功能神经全身控制器 时最需要注意什么局限?
老师先在仿真中看完整的全身目标和更丰富的机器人状态,学会模仿动作;学生只能看真机较容易获得的关节、机身角速度、重力方向和过去 25 步动作,再接收被掩码裁过的命令。学生自己在仿真里行动,老师针对学生实际走到的每个状态给出参考动作,学生据此改正。这就是论文采用 DAgger 的关键:练习的不只是老师从不犯错的路线,也包括学生自己造成的偏差。【论文第 II-D–II-E 节,图 2】