返回报告库

AI / Technology

V-JEPA 2自监督视频模型让理解、预测与规划成为可能

V-JEPA 2 先从大规模视频学视觉规律,再用少量机器人视频补上动作条件。

  1. 它先学“什么会发生”,再学“我的动作会造成什么”。 V-JEPA 2 从 2200 万个视频与图像样本中学习,其中视频总时长超过 100 万小时;随后冻结视觉编码器,只用约 62 小时的机器人交互视频训练动作预测器 V-JEPA 2-AC。来源:摘要、§2.3、§3.1
  2. 它预测重要变化,不执着于还原每个像素。 模型在自己学到的表征空间里补全被遮住的视频片段,重点保留物体、动作和运动轨迹等可预测结构,而不是猜草叶或纹理的精确位置。来源:§1、§2.1
  3. 它已经能规划机械臂,但离通用机器人仍很远。 同一套权重在两个未参与训练的实验室控制 Franka 机械臂,完成到达、抓取和放置;不过每个动作仍需约 16 秒规划,长程预测会积累误差,而且系统依赖人工给出的图像子目标。来源:§4.2–§4.3

逐像素重建会消耗能力追逐细节;表征空间预测更关注稳定的运动结构。

逐像素生成视频时,模型必须处理大量与行动无关的细节,例如每片叶子的位置。V-JEPA 2 改为预测抽象表征:只要球在哪里、往哪移动、机械臂和物体怎样变化这些关键信息保留下来,背景纹理不必逐像素复原。作者认为,这种做法让规划比生成完整视频更省计算。来源:§1

系统比较多个想象结果,只执行第一步,再根据新画面重新规划。

给定当前相机画面和目标图片,系统采样多组候选动作,让 V-JEPA 2-AC 在表征空间里“想象”结果,再选择最接近目标表征的一组。机械臂只执行第一个动作,随后读取新画面并重新规划。这种模型预测控制形成闭环,能不断纠正前一步留下的偏差。来源:§4.1、图 8

同一模型在两个未提供训练数据的实验室执行抓取、搬运与放置。

表中机器人规划时间来自单张 RTX 4090。Cosmos 每步使用 80 个样本,V-JEPA 2-AC 使用 800 个样本,因此时间差说明的是整套规划方案的效率,不是严格同计算量的模型速度对比。来源:表 3

相机位置、滚动误差与长程搜索共同限制了规划能力。

第一,相机角度很敏感。模型没有显式相机标定,有时又看不到机器人底座,只能从画面猜动作坐标轴;作者实际手动尝试多个机位后才选到稳定位置。第二,自回归想象会随时间积累误差,而候选动作序列随规划长度快速增多。第三,拾取放置被拆成多个由人提供的图像子目标;系统还不能直接接收自然语言目标并自行分解长任务。来源:§4.3

研究附录

官方原题: V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
作者: Mahmoud Assran 等|发布日期: 2025 年 6 月 11 日|论文: arXiv:2506.09985领域: 视频理解、世界模型、机器人规划

核心结论

记住这三点就够了

  1. 它先学“什么会发生”,再学“我的动作会造成什么”。 V-JEPA 2 从 2200 万个视频与图像样本中学习,其中视频总时长超过 100 万小时;随后冻结视觉编码器,只用约 62 小时的机器人交互视频训练动作预测器 V-JEPA 2-AC。来源:摘要、§2.3、§3.1
  2. 它预测重要变化,不执着于还原每个像素。 模型在自己学到的表征空间里补全被遮住的视频片段,重点保留物体、动作和运动轨迹等可预测结构,而不是猜草叶或纹理的精确位置。来源:§1、§2.1
  3. 它已经能规划机械臂,但离通用机器人仍很远。 同一套权重在两个未参与训练的实验室控制 Franka 机械臂,完成到达、抓取和放置;不过每个动作仍需约 16 秒规划,长程预测会积累误差,而且系统依赖人工给出的图像子目标。来源:§4.2–§4.3

一句话讲清这篇论文

这篇论文的关键变化,是把机器人学习拆成两段:先用海量普通视频建立视觉世界模型,再用少量带动作信号的机器人视频把“观察到的变化”接到“可以执行的动作”上。最强证据是新环境中的真实机械臂闭环实验;最大风险是实验任务短、样本少、速度慢,且依赖相机位置与图像子目标。这是对论文结果的概括,不等于已经证明模型拥有通用物理理解。来源:§1、§4

问题

机器人数据太少,互联网视频又没有动作标签

传统世界模型常从“状态—动作—下一状态”轨迹中学习,有时还需要奖励信号。真实机器人轨迹昂贵,难以像网页视频一样扩大规模。互联网视频数量巨大,却通常不会告诉模型:画面里的变化对应机器人坐标系中的哪个控制命令。论文要解决的,就是如何让这两类数据各自承担最适合的工作。来源:§1

把未来画得逼真,不等于知道怎样到达未来

逐像素生成视频时,模型必须处理大量与行动无关的细节,例如每片叶子的位置。V-JEPA 2 改为预测抽象表征:只要球在哪里、往哪移动、机械臂和物体怎样变化这些关键信息保留下来,背景纹理不必逐像素复原。作者认为,这种做法让规划比生成完整视频更省计算。来源:§1

它不是从零出现,而是把 JEPA 路线推向机器人规划

V-JEPA 2 直接建立在 JEPA 的表征预测思想和 V-JEPA 的视频遮挡预测方法上。与原始 V-JEPA 相比,本工作把数据从 200 万条视频扩到 2200 万个样本,把编码器从 3 亿参数扩到 10 亿以上,并加入更长训练与渐进式时空分辨率训练;之后再接上动作条件预测器。来源:§1、§2.2

方法

第一阶段:遮住一部分视频,让模型预测缺失内容的表征

视频先被切成时空小块,部分小块随机丢弃。编码器读取剩余内容,预测器根据位置标记猜出缺失部分的表征;一个缓慢更新的目标编码器提供学习目标,以避免所有输入都塌缩成同一个答案。训练数据 VideoMix22M 包含 SSv2、Kinetics、HowTo100M、YT-Temporal-1B 与 ImageNet,共 2200 万个样本;其中视频约 173 万小时。来源:图 2、§2.1、表 1

模型扩大到 10 亿参数,并把训练从 9 万步延长到 25.2 万步。最后 1.2 万步才把输入从 16 帧提高到 64 帧,并增加空间分辨率。这种“先便宜训练、最后提高分辨率”的策略,避免全程处理长视频的高成本;论文报告六项分类任务平均成绩从基线累计提高 4.0 个百分点,达到 88.2%。来源:§2.2、§2.4

第二阶段:冻结视觉能力,只学习动作会怎样改变下一帧

研究者冻结 V-JEPA 2 编码器,再训练一个 3 亿参数的动作条件预测器。它读取过去画面的表征、机械臂末端状态和控制动作,然后自回归预测下一帧表征。训练只用了 DROID 数据集约 62 小时、2.3 万条轨迹;“无标签”表示没有任务名称、成功标记或奖励,但仍包含视频、末端执行器状态和动作信号。来源:§3.1、§4.1

执行时:先在模型里试动作,只迈一步就重新看

给定当前相机画面和目标图片,系统采样多组候选动作,让 V-JEPA 2-AC 在表征空间里“想象”结果,再选择最接近目标表征的一组。机械臂只执行第一个动作,随后读取新画面并重新规划。这种模型预测控制形成闭环,能不断纠正前一步留下的偏差。来源:§4.1、图 8

证据与局限

视频表征确实更擅长读懂动作和时间

冻结编码器后只训练一个小型任务头,V-JEPA 2 ViT-g 384 在 Something-Something v2 上达到 77.3% top-1;原始 V-JEPA 为 74.3%,同协议下 InternVideo2 s2-1B 为 69.7%。六项动作与外观分类的平均成绩为 88.2%。不过各模型预训练数据不同,论文明确提醒:这些结果只能做系统级比较,不能当作完全控制变量的模型优劣证明。来源:表 4、§5

在 Epic-Kitchens-100 的下一动作预测中,V-JEPA 2 达到 39.7 的 action recall@5,高于 PlausiVL 的 27.6;预测间隔从 1 秒拉长到 2、4、10 秒时,成绩明显下降。在视频问答中,接入 Llama 3.1 8B 并使用 8850 万条对齐样本后,PerceptionTest 为 84.0,TempCompass 为 76.9;但 TVBench 与 MVBench 没有超过 PerceptionLM 8B。来源:表 5、§13.2、表 8

最有分量的结果来自两个新实验室的真实机器人

同一模型权重和推理代码被零样本部署到两个 DROID 数据中未出现的实验室。系统只用未标定的低分辨率单目 RGB 相机。在每种设置 10 次试验的平均结果中,V-JEPA 2-AC 的抓杯成功率为 65%,抓盒为 25%,拿着杯子到达为 75%,拿着盒子到达为 75%,杯子拾取放置为 80%,盒子拾取放置为 65%。对应的 Octo 平均结果分别为 15%、0%、15%、70%、15%、10%。来源:§4.2、表 2

实验信号V-JEPA 2 / V-JEPA 2-AC对照或参照怎么读
SSv2 top-177.3%原始 V-JEPA 74.3%更强的细粒度运动识别
EK100 action recall@539.7PlausiVL 27.6更会预测一秒后的动作类别
杯子拾取放置80%Octo 15%新实验室中有明显优势,但每项仅 10 次
盒子拾取放置65%Octo 10%物体形状改变后仍不稳定
单步规划时间16 秒Cosmos 4 分钟比生成视频快,但仍非实时

表中机器人规划时间来自单张 RTX 4090。Cosmos 每步使用 80 个样本,V-JEPA 2-AC 使用 800 个样本,因此时间差说明的是整套规划方案的效率,不是严格同计算量的模型速度对比。来源:表 3

三个限制决定了它还不是通用机器人“大脑”

第一,相机角度很敏感。模型没有显式相机标定,有时又看不到机器人底座,只能从画面猜动作坐标轴;作者实际手动尝试多个机位后才选到稳定位置。第二,自回归想象会随时间积累误差,而候选动作序列随规划长度快速增多。第三,拾取放置被拆成多个由人提供的图像子目标;系统还不能直接接收自然语言目标并自行分解长任务。来源:§4.3

实际意义

对产品和机器人团队,最值得借鉴的是数据分工

论文给出一种务实架构:用便宜、海量、无动作标签的视频学通用视觉变化,再用昂贵但少量的机器人轨迹补动作接口。对现实团队而言,这意味着不必从头收集所有场景的任务示范;可以先复用一个通用视频编码器,再为具体机器人的动作空间训练小得多的预测模块。这是基于实验设计的产品解释,不是论文对生产成本的直接测量。来源:§1、§3

真正落地前,先问四个问题

  • 速度够不够? 当前 16 秒一个动作适合研究演示,不适合多数实时交互。
  • 目标从哪里来? 论文依赖图像子目标;自然语言目标、自动拆解任务尚未验证。
  • 机位能否稳定? 相机移动、遮挡机器人底座或控制坐标改变,都可能让预测失准。
  • 失败代价多大? 论文展示的是桌面抓取与放置,且每种条件通常只有 10 次;安全关键场景需要更大规模、更多扰动和明确失败恢复测试。

这些问题不否定论文的结果。它们说明目前最合理的定位是:V-JEPA 2 证明了“大规模观看 + 少量交互 + 表征空间规划”可以在真实机器人上闭环工作,但尚未证明这种方法能处理开放世界中的长任务、语言目标和高可靠实时控制。来源:§4.2–§4.3

研究读者的核对入口

  • 核心机制: §2 的遮挡表征预测;§3 的动作条件预测器;§4.1 的模型预测控制。
  • 关键数据: 表 1 的 VideoMix22M;表 2–3 的机器人结果;表 4–5 的分类与动作预测;表 8 的视频问答。
  • 最重要的可比性提醒: §5 指出视觉编码器的预训练数据不同,只能进行系统级比较。
  • 最值得复现实验: 更换相机位姿、取消人工图像子目标、增加规划长度,并扩大每种机器人任务的试验次数。

关于这篇论文的三个关键问题

V-JEPA 2:自监督视频模型让理解、预测与规划成为可能 解决了什么问题?

传统世界模型常从“状态—动作—下一状态”轨迹中学习,有时还需要奖励信号。真实机器人轨迹昂贵,难以像网页视频一样扩大规模。互联网视频数量巨大,却通常不会告诉模型:画面里的变化对应机器人坐标系中的哪个控制命令。论文要解决的,就是如何让这两类数据各自承担最适合的工作。来源:§1

V-JEPA 2:自监督视频模型让理解、预测与规划成为可能 的核心结论有哪些证据?

冻结编码器后只训练一个小型任务头,V-JEPA 2 ViT-g 384 在 Something-Something v2 上达到 77.3% top-1;原始 V-JEPA 为 74.3%,同协议下 InternVideo2 s2-1B 为 69.7%。六项动作与外观分类的平均成绩为 88.2%。不过各模型预训练数据不同,论文明确提醒:这些结果只能做系统级比较,不能当作完全控制变量的模型优劣证明。来源:表 4、§5

阅读 V-JEPA 2:自监督视频模型让理解、预测与规划成为可能 时最需要注意什么局限?

冻结编码器后只训练一个小型任务头,V-JEPA 2 ViT-g 384 在 Something-Something v2 上达到 77.3% top-1;原始 V-JEPA 为 74.3%,同协议下 InternVideo2 s2-1B 为 69.7%。六项动作与外观分类的平均成绩为 88.2%。不过各模型预训练数据不同,论文明确提醒:这些结果只能做系统级比较,不能当作完全控制变量的模型优劣证明。来源:表 4、§5

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro