返回报告库

AI / Technology

Genie生成式可交互环境

关于这篇论文的三个关键问题

Genie:生成式可交互环境 解决了什么问题?

文字到视频模型可以生成连贯片段,但用户通常只能在整段视频层面给提示。传统世界模型能根据动作预测下一帧,却往往需要环境提供“画面 + 动作”成对数据。互联网视频量大,却很少记录玩家当时按了什么键。Genie 要解决的缝隙是:能不能只看公开视频,就学会一个可逐帧操控的环境?【§1 表 1;§4】

Genie:生成式可交互环境 的核心结论有哪些证据?

在相近规模的分词器比较中,ST-ViViT 的 FVD 为 81.4、可控性指标为 1.66、显存为 0.9 GB;空间 ViT 分别为 114.5、1.39、0.3 GB,C-ViViT 为 272.7、1.37、1.6 GB。FVD 越低代表视频分布越接近真实样本;论文自定义的可控性指标越高,代表换动作后生成结果变化越明显。这里的证据支持 ST-ViViT 在该实验设置下取得更好的综合结果,不代表它在所有视频任务上都最优。【§3 指标;§3.4 表 3】

阅读 Genie:生成式可交互环境 时最需要注意什么局限?

作者先搜集 5,500 万段、每段 16 秒的平台游戏视频,再用质量分类器筛到 680 万段,共约 3 万小时;分辨率为 160×90、帧率为 10 FPS。最终系统包含 101 亿参数的动力学模型、2 亿参数的视频分词器和 3 亿参数的动作模型,总计约 107 亿参数,训练使用 9,420 亿 token。40M 到 2.7B 参数的缩放实验显示,模型越大,训练损失持续下降;这证明架构能从更多算力获益,但训练损失下降本身不等于长期物理正确。【§3;§3.1;附录 B.1】

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro