返回报告库

AI / Technology

扩散模型就是实时游戏引擎

关于这篇论文的三个关键问题

扩散模型就是实时游戏引擎 解决了什么问题?

普通视频生成可以先拿到条件,再一次生成整段内容。游戏却必须等玩家此刻按键,马上给出下一帧,然后持续响应尚未发生的操作。每一帧还会成为下一帧的输入:一个小错误若不断被送回模型,就可能越滚越大。论文把目标写成“交互式世界模拟”,并区分训练时使用真实历史画面的 teacher forcing 与运行时使用模型自身输出的自回归生成。【来源:§1–§2】

扩散模型就是实时游戏引擎 的核心结论有哪些证据?

四步 DDIM 去噪在论文硬件上需要 40 ms,解码再用 10 ms,因此一帧共 50 ms,也就是 20 FPS。下一帧预测在 2048 条、来自 5 个关卡的留出轨迹上达到 29.4 dB PSNR。10 名受试者比较 130 组短片时,辨认真游戏的比例为 58%(1.6 秒片段)和 60%(3.2 秒片段);在已经自回归运行 5–10 分钟后截取的 150 组 3 秒片段中,这一比例为 50%。这些结果说明短片视觉很逼真,不代表内部状态与原游戏逐项一致。【来源:摘要;§3.3.2;§5.1】

阅读 扩散模型就是实时游戏引擎 时最需要注意什么局限?

去掉噪声增强后,自回归画质通常在 10–20 帧后快速下降。用智能体轨迹训练的模型,单帧 PSNR 为 25.06,而随机策略数据为 24.42;自回归 3 秒后差距扩大到 19.02 对 16.84,说明会探索的智能体更能覆盖后续需要的情境。数据量实验也显示,100 万样本的模型能画新视角,却难以保持一致性和游戏逻辑,甚至不能杀死怪物;7000 万样本在 70 万训练步后仍继续改善。【来源:§5.2.2–§5.2.3;附录 A.3】

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro