返回报告库

AI / Technology

Genie生成式可交互环境

从被动视频到可交互生成

图 1|新意不在于让视频自己延长,而在于把用户选择加入每一次下一帧预测。教学图为重新绘制。

普通视频模型替你决定接下来发生什么。Genie 则从一张图片出发,让用户每一步选择一个“潜在动作”,模型再生成下一帧。这个动作不是人工标注的“左、右、跳”,而是模型从前后画面的变化里自己归纳出来的按钮。论文把这种只靠视频训练、又能逐帧控制的系统称为“生成式可交互环境”。【摘要;§1;§2.2】

无标签视频如何变成可控制动作

图 2|训练数据没有按键记录;模型从相邻画面之间的变化归纳动作,再用动作约束下一帧。教学图为重新绘制。

视频只展示“角色从这里到了那里”,没有告诉模型这是跳跃、重力、镜头移动,还是画面噪声。Genie 必须把可控制的变化从其他变化中分离出来,并把连续世界压进少量按钮。按钮太少会漏掉行为,太多又会让人难以操作;论文最终在平台游戏实验中使用 8 个代码。【§2.1;附录 C.1】

Genie 三组件结构

图 3|画面被压缩成 token;画面变化被压成动作;两者共同决定下一帧。教学图为重新绘制。

视频分词器 先把像素压成离散 token,减少预测负担。潜在动作模型 观察过去与下一帧,把关键变化压成一个离散代码。动力学模型 拿到过去的画面 token 和动作代码,再预测下一帧 token。训练先完成视频分词器,之后联合训练动作模型与动力学模型。【§2.1】

同一动作在不同世界中的直觉

图 4|“潜在”不等于随机:作者观察到同一代码在不同输入上常保留相近含义,像第一次拿到陌生手柄,需要先试出每个键的作用。【§2.2】教学图为重新绘制。

动作编码器能看到过去和下一帧,解码器却只能看到过去与压缩后的动作。如果动作代码没有保留关键变化,解码器就难以还原下一帧。这个约束迫使代码表达诸如移动或跳跃之类的变化。论文用 VQ-VAE 目标把代码限制为离散集合;推理时丢掉动作编码器,由用户直接选代码。【§2.1,图 4】

架构消融与动作迁移证据

图 5|左:ST-ViViT 的论文原值。右:潜在动作先标记专家视频,再用 200 条带真实动作的样本完成按键映射。教学图为重新绘制。

作者冻结平台视频上学到的动作模型,用它给未见过的 CoinRun 专家视频贴潜在动作标签,再训练策略模仿。最后仍需一小批带真实动作的专家样本,把潜在代码映射成环境按键。在论文的简单和困难 CoinRun 设置中,只用 200 个带动作样本适配,策略就达到能看到全部专家动作的行为克隆上界得分。这个实验说明动作代码有迁移价值;它不是“完全零动作标签”训练出真实控制器。【§3.3;附录 E】

当前原型的三重边界

图 6|短记忆、慢响应和累积误差共同限制了长期可玩性。教学图为重新绘制。

论文明确列出三项限制:自回归生成可能把小错误越滚越大,最后出现不真实未来;模型只记住 16 帧,难以维持长时间一致的环境;运行速度约 1 FPS,离顺滑交互还有距离。主模型权重、训练集和其中样本也没有随论文公开,大规模结果难以独立复现。【§5;Broader Impact—Training Data and Weights;Reproducibility】

研究附录

官方原题: Genie: Generative Interactive Environments
作者: Jake Bruce、Michael Dennis、Ashley Edwards、Jack Parker-Holder 等 25 人(Google DeepMind)
论文: arXiv:2402.15391 · 2024 年 2 月 23 日提交
研究类型: 生成式世界模型 · 视频建模 · 无监督动作学习

核心结论

它把“看视频”变成了“按一下,世界就回应一下”

普通视频模型替你决定接下来发生什么。Genie 则从一张图片出发,让用户每一步选择一个“潜在动作”,模型再生成下一帧。这个动作不是人工标注的“左、右、跳”,而是模型从前后画面的变化里自己归纳出来的按钮。论文把这种只靠视频训练、又能逐帧控制的系统称为“生成式可交互环境”。【摘要;§1;§2.2】

记住三点就够了

  1. 训练时只看视频。 主模型没有使用动作标签或文本标签,却学出一套能影响下一帧的离散动作。【§1;§2.1】
  2. 控制来自画面变化。 模型比较前后帧,把最有用的变化压成 8 个动作代码;推理时,用户直接选择代码。【§2.1;附录 C.1】
  3. 这是研究原型,不是现成游戏引擎。 它只有 16 帧记忆,约以 1 FPS 运行,也可能生成不真实的未来。【§5】

问题

一段会继续播放的视频,不等于一个能回应你的环境

文字到视频模型可以生成连贯片段,但用户通常只能在整段视频层面给提示。传统世界模型能根据动作预测下一帧,却往往需要环境提供“画面 + 动作”成对数据。互联网视频量大,却很少记录玩家当时按了什么键。Genie 要解决的缝隙是:能不能只看公开视频,就学会一个可逐帧操控的环境?【§1 表 1;§4】

真正难的是从结果倒推动作

视频只展示“角色从这里到了那里”,没有告诉模型这是跳跃、重力、镜头移动,还是画面噪声。Genie 必须把可控制的变化从其他变化中分离出来,并把连续世界压进少量按钮。按钮太少会漏掉行为,太多又会让人难以操作;论文最终在平台游戏实验中使用 8 个代码。【§2.1;附录 C.1】

方法

三个组件各做一件事

视频分词器 先把像素压成离散 token,减少预测负担。潜在动作模型 观察过去与下一帧,把关键变化压成一个离散代码。动力学模型 拿到过去的画面 token 和动作代码,再预测下一帧 token。训练先完成视频分词器,之后联合训练动作模型与动力学模型。【§2.1】

动作模型靠“必须重建下一帧”获得压力

动作编码器能看到过去和下一帧,解码器却只能看到过去与压缩后的动作。如果动作代码没有保留关键变化,解码器就难以还原下一帧。这个约束迫使代码表达诸如移动或跳跃之类的变化。论文用 VQ-VAE 目标把代码限制为离散集合;推理时丢掉动作编码器,由用户直接选代码。【§2.1,图 4】

时空注意力让模型既看位置,也看时间

普通 Transformer 让所有视频 token 彼此注意,帧数增加时成本很快上升。Genie 交替使用空间注意力和时间注意力:先看同一帧内的位置关系,再看同一位置跨帧的变化。论文称它为 ST-Transformer,并把它用于三个组件;其中主要的空间计算量随帧数线性增长。【§2;图 3】

证据与局限

数据与规模说明它能扩展,但不能单独证明它“理解世界”

作者先搜集 5,500 万段、每段 16 秒的平台游戏视频,再用质量分类器筛到 680 万段,共约 3 万小时;分辨率为 160×90、帧率为 10 FPS。最终系统包含 101 亿参数的动力学模型、2 亿参数的视频分词器和 3 亿参数的动作模型,总计约 107 亿参数,训练使用 9,420 亿 token。40M 到 2.7B 参数的缩放实验显示,模型越大,训练损失持续下降;这证明架构能从更多算力获益,但训练损失下降本身不等于长期物理正确。【§3;§3.1;附录 B.1】

消融结果显示“怎么压视频”会同时影响画质和控制

在相近规模的分词器比较中,ST-ViViT 的 FVD 为 81.4、可控性指标为 1.66、显存为 0.9 GB;空间 ViT 分别为 114.5、1.39、0.3 GB,C-ViViT 为 272.7、1.37、1.6 GB。FVD 越低代表视频分布越接近真实样本;论文自定义的可控性指标越高,代表换动作后生成结果变化越明显。这里的证据支持 ST-ViViT 在该实验设置下取得更好的综合结果,不代表它在所有视频任务上都最优。【§3 指标;§3.4 表 3】

分词器FVD ↓可控性 ↑显存
空间 ViT114.51.390.3 GB
C-ViViT272.71.371.6 GB
ST-ViViT81.41.660.9 GB

学出的动作能迁移,但仍需要少量真实动作对齐

作者冻结平台视频上学到的动作模型,用它给未见过的 CoinRun 专家视频贴潜在动作标签,再训练策略模仿。最后仍需一小批带真实动作的专家样本,把潜在代码映射成环境按键。在论文的简单和困难 CoinRun 设置中,只用 200 个带动作样本适配,策略就达到能看到全部专家动作的行为克隆上界得分。这个实验说明动作代码有迁移价值;它不是“完全零动作标签”训练出真实控制器。【§3.3;附录 E】

最大问题发生在你连续玩下去之后

论文明确列出三项限制:自回归生成可能把小错误越滚越大,最后出现不真实未来;模型只记住 16 帧,难以维持长时间一致的环境;运行速度约 1 FPS,离顺滑交互还有距离。主模型权重、训练集和其中样本也没有随论文公开,大规模结果难以独立复现。【§5;Broader Impact—Training Data and Weights;Reproducibility】

实际意义

它打开的是“把观看数据变成练习场”的路线

这篇论文最值得带走的产品含义,是训练交互环境不再必然要求逐条记录动作。若同一路线能扩展到更多真实视频,机器人或智能体可能先从观察中归纳“有哪些可做的事”,再用少量带动作数据把这些抽象动作接到真实控制器上。这是基于论文 CoinRun 与机器人视频实验的合理延伸,不是作者已经完成的通用训练平台。【§3.2–3.3;§5,解释】

现在适合把它当研究方向,不适合把它当生产级模拟器

Genie 展示了单张图片、草图、生成图和真实照片都能作为起始画面,并报告机器人模型在测试集上达到 FVD 82.7、学出方向一致的机械臂动作。可论文主要展示的是短片段和定性案例,没有证明长期因果一致性、安全性或真实物理精度。对游戏创作,它更像可操作的概念草图;对机器人,它更像动作表征的预训练线索,而不是可替代真实验证的模拟器。【§3.2;§5,解释】

继续验证时,先问这五个问题

  • 当交互超过 16 帧,场景、物体与目标还能保持一致多久?
  • 同一个潜在动作跨游戏、镜头和角色时,含义是否仍稳定?
  • 自定义可控性指标与真人“按键是否听话”的评价相关多强?
  • 用于机器人时,生成变化是否满足真实接触与安全约束?
  • 在数据和主权重未公开的情况下,哪些结论能被独立团队复现?

术语与核验附录

  • 生成式可交互环境: 给定起始画面和每一步动作,持续生成下一帧的模型。【摘要】
  • 潜在动作: 没有人工语义标签、由视频变化自动学出的离散控制代码。【§2.1】
  • 视频 token: 对像素画面的离散压缩表示,用来降低预测维度。【§2.1】
  • FVD: 比较生成视频与真实视频特征分布的距离;在同一设置中通常越低越好。【§3 指标】
  • 不确定项: ar5iv 的公式转写遗漏了论文中自定义可控性指标的符号,因此本文只使用表格原值与作者给出的方向性定义,不重写公式。

主要来源: Bruce et al., Genie: Generative Interactive Environments, arXiv:2402.15391v1。正文中的 §、表号和附录号均指向该论文。

关于这篇论文的三个关键问题

Genie:生成式可交互环境 解决了什么问题?

文字到视频模型可以生成连贯片段,但用户通常只能在整段视频层面给提示。传统世界模型能根据动作预测下一帧,却往往需要环境提供“画面 + 动作”成对数据。互联网视频量大,却很少记录玩家当时按了什么键。Genie 要解决的缝隙是:能不能只看公开视频,就学会一个可逐帧操控的环境?【§1 表 1;§4】

Genie:生成式可交互环境 的核心结论有哪些证据?

在相近规模的分词器比较中,ST-ViViT 的 FVD 为 81.4、可控性指标为 1.66、显存为 0.9 GB;空间 ViT 分别为 114.5、1.39、0.3 GB,C-ViViT 为 272.7、1.37、1.6 GB。FVD 越低代表视频分布越接近真实样本;论文自定义的可控性指标越高,代表换动作后生成结果变化越明显。这里的证据支持 ST-ViViT 在该实验设置下取得更好的综合结果,不代表它在所有视频任务上都最优。【§3 指标;§3.4 表 3】

阅读 Genie:生成式可交互环境 时最需要注意什么局限?

作者先搜集 5,500 万段、每段 16 秒的平台游戏视频,再用质量分类器筛到 680 万段,共约 3 万小时;分辨率为 160×90、帧率为 10 FPS。最终系统包含 101 亿参数的动力学模型、2 亿参数的视频分词器和 3 亿参数的动作模型,总计约 107 亿参数,训练使用 9,420 亿 token。40M 到 2.7B 参数的缩放实验显示,模型越大,训练损失持续下降;这证明架构能从更多算力获益,但训练损失下降本身不等于长期物理正确。【§3;§3.1;附录 B.1】

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro