AI / Technology
扩散模型就是实时游戏引擎
传统引擎与 GameNGen 的循环对比
图 1|传统引擎用明确规则更新状态再渲染;GameNGen 用按键和最近画面直接预测下一帧。示意图依据 §1–§3 重新绘制。
- 它把游戏循环从手写规则换成了下一帧预测。 玩家按键和最近的画面一起进入扩散模型,模型直接生成下一帧,再把这一帧送回自己继续生成。
- 它证明复杂游戏可以由神经模型实时驱动。 在单个 TPU v5 上,四步去噪版本以 20 FPS 运行 DOOM;短片人评中,受试者辨认真实游戏的正确率只略高于随机猜测。
- 它仍是在模仿一个现成游戏。 模型只看到约 3 秒历史,可能猜错更久以前发生的事;论文也没有证明它能可靠创造新游戏或在消费级硬件上运行。【来源:摘要;§1;§7】
GameNGen 的两阶段训练
图 2|智能体负责大规模“试玩并录像”,扩散模型随后学习动作与下一帧的对应关系;真人只在训练完成后操作模拟器。依据 §3 重绘。
研究者先用 PPO 训练一个智能体玩 ViZDoom,并保留它从随机乱按到逐渐熟练的全部轨迹。每条轨迹都包含画面和动作。智能体共经历 5000 万个环境步;生成模型最终使用其中随机抽取的 7000 万个样本。奖励函数是方法中唯一专门针对 DOOM 设计的部分。【来源:§3.1;§4.1–§4.2;附录 A.5】
噪声增强如何抑制误差累积
图 3|上方是错误被反复回灌后逐步放大;下方表示训练时主动加入扰动,让模型学习修正不完美上下文。依据 §3.2.1 与图 4、图 7 重绘。
训练时,模型看到的历史画面来自真实游戏;运行时,它看到的却是自己生成的画面,两者有细小差异。研究者因此给训练上下文加入不同强度的高斯噪声,并告诉模型噪声等级。这样,模型练习的不是只接“标准答案”,而是从有瑕疵的历史里纠偏。另一个独立微调只优化潜空间解码器,用来修复 HUD 数字等小细节,不改变自回归状态更新。【来源:§3.2.1–§3.2.2】
四步去噪的实时推理预算
图 4|论文报告单次去噪和解码各需 10 ms;四次去噪加一次解码合计 50 ms。依据 §3.3.2。
四步 DDIM 去噪在论文硬件上需要 40 ms,解码再用 10 ms,因此一帧共 50 ms,也就是 20 FPS。下一帧预测在 2048 条、来自 5 个关卡的留出轨迹上达到 29.4 dB PSNR。10 名受试者比较 130 组短片时,辨认真游戏的比例为 58%(1.6 秒片段)和 60%(3.2 秒片段);在已经自回归运行 5–10 分钟后截取的 150 组 3 秒片段中,这一比例为 50%。这些结果说明短片视觉很逼真,不代表内部状态与原游戏逐项一致。【来源:摘要;§3.3.2;§5.1】
短历史无法完整保存隐藏状态
图 5|画面能暴露部分状态,但约 3 秒历史无法可靠保存所有早先事件;模型可能用相关线索替代真正记忆。依据 §7 重绘。
模型读取最近 64 帧。按 20 FPS 算,这只覆盖略多于 3 秒。血量、弹药和武器等状态可以从屏幕上直接看到;更久以前敌人是否已被消灭,模型往往只能根据当前位置和 HUD 猜测。论文给出的失败例子很直白:玩家连续开枪时,模型可能反过来“猜”附近应该有敌人,于是生成一个敌人。【来源:§4.2;§7】
研究附录
官方原题: Diffusion Models Are Real-Time Game Engines
作者: Dani Valevski、Yaniv Leviathan、Moab Arar、Shlomi Fruchter
版本: arXiv:2408.14837v2,2025-04-24 修订;ICLR 2025
原文: arXiv 摘要 · HTML 全文
核心结论
三句话记住 GameNGen
- 它把游戏循环从手写规则换成了下一帧预测。 玩家按键和最近的画面一起进入扩散模型,模型直接生成下一帧,再把这一帧送回自己继续生成。
- 它证明复杂游戏可以由神经模型实时驱动。 在单个 TPU v5 上,四步去噪版本以 20 FPS 运行 DOOM;短片人评中,受试者辨认真实游戏的正确率只略高于随机猜测。
- 它仍是在模仿一个现成游戏。 模型只看到约 3 秒历史,可能猜错更久以前发生的事;论文也没有证明它能可靠创造新游戏或在消费级硬件上运行。【来源:摘要;§1;§7】
问题
玩家会随时改写未来
普通视频生成可以先拿到条件,再一次生成整段内容。游戏却必须等玩家此刻按键,马上给出下一帧,然后持续响应尚未发生的操作。每一帧还会成为下一帧的输入:一个小错误若不断被送回模型,就可能越滚越大。论文把目标写成“交互式世界模拟”,并区分训练时使用真实历史画面的 teacher forcing 与运行时使用模型自身输出的自回归生成。【来源:§1–§2】
以前的神经模拟器卡在哪里?
论文把 World Models、GameGAN、Genie 等工作放在同一条探索线上:它们已经说明模型能学习游戏或交互环境,但常在游戏复杂度、速度、长时间稳定性或画质之间取舍。GameNGen 的问题更窄也更硬:能否让一个神经模型在现有硬件上,以高画质、实时、长轨迹的方式模拟复杂游戏?【来源:§1;§6;图 2】
方法
第一步:让不同水平的智能体留下 7000 万条样本
研究者先用 PPO 训练一个智能体玩 ViZDoom,并保留它从随机乱按到逐渐熟练的全部轨迹。每条轨迹都包含画面和动作。智能体共经历 5000 万个环境步;生成模型最终使用其中随机抽取的 7000 万个样本。奖励函数是方法中唯一专门针对 DOOM 设计的部分。【来源:§3.1;§4.1–§4.2;附录 A.5】
第二步:把文生图模型改成“动作到下一帧”模型
GameNGen 从 Stable Diffusion v1.4 开始训练,但移除文字条件。按键被编码成动作 token,最近 64 帧则进入潜空间,与当前待去噪的表示拼接。模型学习在这些动作和画面条件下预测下一帧。训练分辨率为 320×240,并填充到 320×256;U-Net 在 128 个 TPU v5e 上训练 70 万步。【来源:§3.2;§4.2】
第三步:故意弄脏历史画面,让模型学会收拾自己的错误
训练时,模型看到的历史画面来自真实游戏;运行时,它看到的却是自己生成的画面,两者有细小差异。研究者因此给训练上下文加入不同强度的高斯噪声,并告诉模型噪声等级。这样,模型练习的不是只接“标准答案”,而是从有瑕疵的历史里纠偏。另一个独立微调只优化潜空间解码器,用来修复 HUD 数字等小细节,不改变自回归状态更新。【来源:§3.2.1–§3.2.2】
证据与局限
最强证据来自速度、下一帧画质和人评
四步 DDIM 去噪在论文硬件上需要 40 ms,解码再用 10 ms,因此一帧共 50 ms,也就是 20 FPS。下一帧预测在 2048 条、来自 5 个关卡的留出轨迹上达到 29.4 dB PSNR。10 名受试者比较 130 组短片时,辨认真游戏的比例为 58%(1.6 秒片段)和 60%(3.2 秒片段);在已经自回归运行 5–10 分钟后截取的 150 组 3 秒片段中,这一比例为 50%。这些结果说明短片视觉很逼真,不代表内部状态与原游戏逐项一致。【来源:摘要;§3.3.2;§5.1】
| 观察 | 论文中的数值 | 应该怎样理解 |
|---|---|---|
| 单 TPU v5 推理 | 20 FPS | 四步去噪版本可实时交互 |
| teacher-forcing 下一帧 | PSNR 29.4 dB | 与真实下一帧的像素质量较高,不是长期逻辑分数 |
| 1.6 / 3.2 秒短片人评 | 58% / 60% 选中真游戏 | 只略高于随机猜测 50% |
| 运行 5–10 分钟后截取 3 秒 | 50% 选中真游戏 | 说明局部视觉仍可信,不证明整段轨迹状态正确 |
消融实验说明哪些部件真的重要
去掉噪声增强后,自回归画质通常在 10–20 帧后快速下降。用智能体轨迹训练的模型,单帧 PSNR 为 25.06,而随机策略数据为 24.42;自回归 3 秒后差距扩大到 19.02 对 16.84,说明会探索的智能体更能覆盖后续需要的情境。数据量实验也显示,100 万样本的模型能画新视角,却难以保持一致性和游戏逻辑,甚至不能杀死怪物;7000 万样本在 70 万训练步后仍继续改善。【来源:§5.2.2–§5.2.3;附录 A.3】
最大短板是只有约 3 秒记忆
模型读取最近 64 帧。按 20 FPS 算,这只覆盖略多于 3 秒。血量、弹药和武器等状态可以从屏幕上直接看到;更久以前敌人是否已被消灭,模型往往只能根据当前位置和 HUD 猜测。论文给出的失败例子很直白:玩家连续开枪时,模型可能反过来“猜”附近应该有敌人,于是生成一个敌人。【来源:§4.2;§7】
此外,采集数据的智能体没有探索所有地点和交互;系统只在 DOOM 上充分展示;标准版本依赖 TPU v5;作者也明确承认目前无法方便地制作新游戏。熟悉缺陷的作者本人往往几秒内就能认出模拟画面,这也提醒我们不要把短片盲测结果读成“与原游戏完全相同”。【来源:§5.1;§7】
实际意义
近期价值是可交互模拟,不是替代 Unity 或 Unreal
这篇论文最可信的产品含义,是动作条件生成已经能跨过实时门槛,并在复杂视觉环境中维持可玩的局部一致性。它可能先用于快速原型、已有游戏的行为改造、可交互视频环境或智能体训练。把文字或示例图直接变成完整新游戏,仍是作者提出但尚未验证的方向。【来源:§7;产品含义为基于论文结果的解释】
下一步要验证的不是“更像”,而是“更可靠”
后续系统至少要回答四个问题:能否保存分钟级、可查询的显式状态;能否覆盖人类会做但采集智能体没做过的操作;能否在更多游戏与消费级硬件上复现速度;能否让设计者编辑规则并验证结果,而不只是改变画面。只有这些问题得到解决,“模型权重就是游戏”才会从展示走向可控的开发工具。【来源:§7;验证问题为基于论文局限的解释】
研究脉络与核查入口
- World Models(2018):用 VAE 与 RNN 在潜空间模仿 ViZDoom,再让控制器在“想象”的环境中学习。【来源:§6;参考文献 Ha & Schmidhuber, 2018】
- GameGAN(2020):从动作与画面学习可交互的游戏模拟器,以 LSTM 表示状态并用对抗目标生成画面。【来源:§6;参考文献 Kim et al., 2020】
- Stable Diffusion / Latent Diffusion(2022):GameNGen 直接改造 Stable Diffusion v1.4,把文本条件换成动作和历史帧。【来源:§1;§3.2;参考文献 Rombach et al., 2022】
- Genie(2024):同属生成式交互环境路线,重点包括从视频中无监督学习动作;GameNGen 将比较焦点推进到复杂游戏的速度、画质与长轨迹稳定性。【来源:§1;§6;参考文献 Bruce et al., 2024】
核查时优先看: §3.2.1 的稳定化机制、§3.3.2 的速度预算、§5.1 的人评设计,以及 §7 的作者自述限制。论文 HTML 部分表格数值渲染不完整时,应以 arXiv PDF 为准。
关于这篇论文的三个关键问题
扩散模型就是实时游戏引擎 解决了什么问题?
普通视频生成可以先拿到条件,再一次生成整段内容。游戏却必须等玩家此刻按键,马上给出下一帧,然后持续响应尚未发生的操作。每一帧还会成为下一帧的输入:一个小错误若不断被送回模型,就可能越滚越大。论文把目标写成“交互式世界模拟”,并区分训练时使用真实历史画面的 teacher forcing 与运行时使用模型自身输出的自回归生成。【来源:§1–§2】
扩散模型就是实时游戏引擎 的核心结论有哪些证据?
四步 DDIM 去噪在论文硬件上需要 40 ms,解码再用 10 ms,因此一帧共 50 ms,也就是 20 FPS。下一帧预测在 2048 条、来自 5 个关卡的留出轨迹上达到 29.4 dB PSNR。10 名受试者比较 130 组短片时,辨认真游戏的比例为 58%(1.6 秒片段)和 60%(3.2 秒片段);在已经自回归运行 5–10 分钟后截取的 150 组 3 秒片段中,这一比例为 50%。这些结果说明短片视觉很逼真,不代表内部状态与原游戏逐项一致。【来源:摘要;§3.3.2;§5.1】
阅读 扩散模型就是实时游戏引擎 时最需要注意什么局限?
去掉噪声增强后,自回归画质通常在 10–20 帧后快速下降。用智能体轨迹训练的模型,单帧 PSNR 为 25.06,而随机策略数据为 24.42;自回归 3 秒后差距扩大到 19.02 对 16.84,说明会探索的智能体更能覆盖后续需要的情境。数据量实验也显示,100 万样本的模型能画新视角,却难以保持一致性和游戏逻辑,甚至不能杀死怪物;7000 万样本在 70 万训练步后仍继续改善。【来源:§5.2.2–§5.2.3;附录 A.3】