AI / Technology
Cosmos面向物理 AI 的世界基础模型平台
真实试错与数字世界中的安全筛选
Cosmos 的重点不是单个会生成视频的模型,而是一整套平台:先从海量视频里挑出适合学习运动和变化的片段,再把视频压缩成 token,用扩散与自回归两条路线预训练通用模型,最后用某个机器人或车辆的专用数据做后训练。输入和输出外还有护栏。它想降低的核心成本,是让物理 AI 不必把每次探索都放到真实机器和真实环境里。来源:论文摘要、§2.2、图 4
Cosmos 平台从视频到专用模型的完整路径
数据流水线依次做镜头切分、过滤、描述、语义去重和分片。它把约 2000 万小时、720p 到 4K 的原始视频,整理为约 1 亿个 2–60 秒片段;每 256 帧生成一条描述。过滤会处理静止或剧烈抖动、低画质、后期叠字和不合适的视频类型。基础设施用 Ray 串起分布式处理;论文报告一组转码优化把吞吐从 0.0574 提到 0.3702 videos/s。来源:§1、§3,表 2
因果视频 tokenizer 只使用过去与现在
原始像素太多,直接训练代价很高。Cosmos 用因果编码器把视频压成连续或离散 token,再由解码器还原;“因果”指处理当前帧时不偷看未来帧。连续 token 供扩散模型逐步去噪,离散 token 供自回归模型按顺序预测下一个 token。论文还建立 TokenBench,覆盖机器人操作、驾驶、第一视角和网络视频,用来衡量高分辨率、长视频的压缩质量。来源:§4、§5
大规模预训练把通用底座变成三类专用模型
扩散路线先学 Text2World,再学“过去视频 + 文字 → 未来视频”;自回归路线先做未来帧预测,再加入文字条件。所有论文中的 WFM 在 H100 集群上训练约三个月。后训练阶段再加入相机位姿、机器人动作或车辆轨迹等新条件,把通用模型改造成相机导航、机器人操作和六视角驾驶样例。来源:§5、§6
视觉合理不代表物理可靠
论文结论明确列出三类问题:物体被遮挡后可能不再出现,接触丰富的动作可能违反动力学,模型还会偏离指令。自回归模型也观察到物体从画面下方意外出现;扩散解码器能让画面更清晰,却不能据此证明物理规律更准确。最大的未解风险,是下游决策会放大世界模型的错误,而论文尚未给出完整策略闭环或真实部署验证。来源:§5.2.7、§8 Limitations
研究附录
官方标题: Cosmos World Foundation Model Platform for Physical AI
作者: NVIDIA,Niket Agarwal 等 · 版本: arXiv:2501.03575v3(2025-07-09)
原文: arXiv 摘要页 · 论文全文
核心结论
这项工作交付的是一套“造世界模型的流水线”
Cosmos 的重点不是单个会生成视频的模型,而是一整套平台:先从海量视频里挑出适合学习运动和变化的片段,再把视频压缩成 token,用扩散与自回归两条路线预训练通用模型,最后用某个机器人或车辆的专用数据做后训练。输入和输出外还有护栏。它想降低的核心成本,是让物理 AI 不必把每次探索都放到真实机器和真实环境里。来源:论文摘要、§2.2、图 4
教学图:真实试错可能损坏机器或环境;世界模型的价值,是先在数字环境里筛掉明显不行的动作。图为重新绘制的概念说明,不是论文原图。
记住三点:
- 它是平台,不只是模型。 数据整理、视频 tokenizer、两类生成模型、后训练示例和护栏共同组成交付物。
- 它采用“通才变专才”。 大规模视频预训练提供通用底座,再用较小的任务数据适配相机、机器人和驾驶场景。
- 它还不是可靠模拟器。 论文展示了生成与适配能力,也明确承认对象恒常性、接触动力学和指令跟随仍会失败。
问题
物理 AI 缺的不是视频,而是安全、可扩展的交互经验
聊天模型可以从静态文本扩大学习规模,机器人却需要“看到什么—采取什么动作—世界怎样变化”的连续记录。探索性动作还可能撞坏设备、物体或伤及环境,所以真实世界的数据既贵又危险。论文把世界基础模型定义为一种数字世界:它根据过去的 RGB 视频和当前扰动,生成下一段世界状态;扰动可以是动作、轨迹或文字条件。来源:§1、§2
论文先搭基础设施,没有证明完整的机器人闭环
作者设想世界模型可用于策略评估、策略训练、规划和合成数据,但论文明确说,没有提供这些用途的实证结果。当前展示的是世界生成、相机控制、机器人动作条件预测和多视角驾驶等样例;这些后训练模型也被标为 sample,并非可直接用于现实任务的完整产品。来源:§2.1、§6 与表 21
方法
第一步:把 2000 万小时原始视频筛成约 1 亿个可学片段
数据流水线依次做镜头切分、过滤、描述、语义去重和分片。它把约 2000 万小时、720p 到 4K 的原始视频,整理为约 1 亿个 2–60 秒片段;每 256 帧生成一条描述。过滤会处理静止或剧烈抖动、低画质、后期叠字和不合适的视频类型。基础设施用 Ray 串起分布式处理;论文报告一组转码优化把吞吐从 0.0574 提到 0.3702 videos/s。来源:§1、§3,表 2
教学图:平台把原始视频、筛选、tokenizer、两类预训练模型和三类后训练样例连成一条路径;护栏覆盖输入与输出。
第二步:先压缩视频,再让模型预测世界
原始像素太多,直接训练代价很高。Cosmos 用因果编码器把视频压成连续或离散 token,再由解码器还原;“因果”指处理当前帧时不偷看未来帧。连续 token 供扩散模型逐步去噪,离散 token 供自回归模型按顺序预测下一个 token。论文还建立 TokenBench,覆盖机器人操作、驾驶、第一视角和网络视频,用来衡量高分辨率、长视频的压缩质量。来源:§4、§5
教学图:视频被压成较短的 token 序列再重建;当前 token 不依赖未来画面。
第三步:大规模预训练后,再注入任务控制信号
扩散路线先学 Text2World,再学“过去视频 + 文字 → 未来视频”;自回归路线先做未来帧预测,再加入文字条件。所有论文中的 WFM 在 H100 集群上训练约三个月。后训练阶段再加入相机位姿、机器人动作或车辆轨迹等新条件,把通用模型改造成相机导航、机器人操作和六视角驾驶样例。来源:§5、§6
教学图:广泛视频提供通用底座,较小的专用数据负责把控制方式对准具体任务。
证据与局限
最扎实的证据来自可量化的部件与受控测试
数据工程给出了明确吞吐数字;tokenizer 在多个图像与视频基准上与已有方法比较;3D 一致性测试使用 RealEstate10K 测试集随机选取的 500 段静态场景视频,并用极几何与新视角合成指标评估。相机控制样例展示了前进、后退、左转和右转,并查看生成视频的第 14、28、42、57 帧。这些证据说明平台能规模化运转,也能对部分生成性质做受控检查。来源:§3.2、§4.3、§5.3.1、图 22
“像真的”仍不等于“物理上可信”
论文结论明确列出三类问题:物体被遮挡后可能不再出现,接触丰富的动作可能违反动力学,模型还会偏离指令。自回归模型也观察到物体从画面下方意外出现;扩散解码器能让画面更清晰,却不能据此证明物理规律更准确。最大的未解风险,是下游决策会放大世界模型的错误,而论文尚未给出完整策略闭环或真实部署验证。来源:§5.2.7、§8 Limitations
教学图:生成画面可以很逼真,同时仍在对象恒常性、接触关系或指令跟随上出错。
实际意义
最现实的用法是先做数据与候选方案生成器
对机器人或自动驾驶团队,Cosmos 更像可复用的研究底座:整理视频、建立任务相关生成器、扩充边缘场景,并在昂贵的真实测试前筛掉一批失败候选。把它直接当成高保真物理引擎或安全认证工具,则超出了论文证据。实际项目仍需要真实传感器回放、任务指标、仿真对照和实机验证。
读论文时要追问这五件事
- 生成视频的控制信号,是否和真实设备动作严格对齐?
- 评估看的是画面质量,还是任务成功率与物理误差?
- 失败是否集中在遮挡、碰撞、长时序或罕见场景?
- 后训练数据量和真实部署差距有多大?论文没有给出统一答案。
- 护栏只过滤有害内容,还是也能拦截物理上不可信的未来?论文只支持前者。
术语与来源附记
世界基础模型(WFM):根据过去观察和当前扰动生成未来观察的通用模型。视频 tokenizer:把像素视频压成更短的连续向量或离散编号。后训练:在通用预训练模型上,用特定环境数据加入相机、动作、轨迹等控制能力。本文的事实性描述以论文 v3 的摘要、§1–§8、表 2、表 21 和结论局限为依据;面向产品的建议属于基于这些证据的解释,不是作者已验证的结论。
关于这篇论文的三个关键问题
Cosmos:面向物理 AI 的世界基础模型平台 解决了什么问题?
聊天模型可以从静态文本扩大学习规模,机器人却需要“看到什么—采取什么动作—世界怎样变化”的连续记录。探索性动作还可能撞坏设备、物体或伤及环境,所以真实世界的数据既贵又危险。论文把世界基础模型定义为一种数字世界:它根据过去的 RGB 视频和当前扰动,生成下一段世界状态;扰动可以是动作、轨迹或文字条件。来源:§1、§2
Cosmos:面向物理 AI 的世界基础模型平台 的核心结论有哪些证据?
数据工程给出了明确吞吐数字;tokenizer 在多个图像与视频基准上与已有方法比较;3D 一致性测试使用 RealEstate10K 测试集随机选取的 500 段静态场景视频,并用极几何与新视角合成指标评估。相机控制样例展示了前进、后退、左转和右转,并查看生成视频的第 14、28、42、57 帧。这些证据说明平台能规模化运转,也能对部分生成性质做受控检查。来源:§3.2、§4.3、§5.3.1、图 22
阅读 Cosmos:面向物理 AI 的世界基础模型平台 时最需要注意什么局限?
论文结论明确列出三类问题:物体被遮挡后可能不再出现,接触丰富的动作可能违反动力学,模型还会偏离指令。自回归模型也观察到物体从画面下方意外出现;扩散解码器能让画面更清晰,却不能据此证明物理规律更准确。最大的未解风险,是下游决策会放大世界模型的错误,而论文尚未给出完整策略闭环或真实部署验证。来源:§5.2.7、§8 Limitations