返回报告库

AI / Technology

ContentV:在256个64GB NPU上训练的8B文生视频模型

这篇论文提出 ContentV:一个基于 Stable Diffusion 3.5 Large 的 8B 文本到视频模型,目标是在算力受限但又要追求高质量的条件下,把长视频训练做得更稳、更省、更可复用。

为什么不能直接沿用“先图像、后视频”的老路

两阶段旧路为什么卡住

视频生成比图像生成更吃显存,因为模型不仅要看“长什么样”,还要记住“前后怎么变”。当序列拉长、分辨率升高时,训练就很容易被内存和计算拖住。

论文把问题指向两件事:一是现有两阶段范式效率不够,二是低质量、重复的视频数据会把生成效果拉低。也就是说,困难不只在模型结构,还在数据和训练方式本身。

先把输入和底座改对,模型才有机会学会视频

底座与数据一起重做

ContentV 不从零开始,而是复用 Stable Diffusion 3.5 Large 的图像生成底座,再把其中的 2D-VAE 换成 3D-VAE,并加入 3D 位置编码。直观地说,这是把“只会看单张图”的骨架,改成能感知时间变化的骨架。

为了让训练数据更干净,作者先把视频切成剪辑,再做分镜、去重、字幕和水印检测、模糊与动态评分、审美评分等筛选。最终获得约 100 万条剪辑作为预训练数据。这里的关键不是多,而是尽量把重复、噪声和不一致的片段挡在外面。

为什么要分阶段训练,而不是一次把所有目标都塞进去

分阶段把难题拆开

论文把训练拆成几个阶段:先学基础的视频表征,再逐步加入更长、更高分辨率的序列,最后用 SFT 和 RLHF 把质量往上推。这样做的理由很现实:如果一开始就让模型面对最难的长视频任务,训练更容易不稳定。

文中给出的配置是 Stage1 5k 步、Stage2 40k 步、Stage3 60k 步、SFT 5k 步。作者还提到,Stage2 主要负责学到动态视觉表征,所以分配了大部分算力。SFT 阶段把学习率降到预训练的 10%,并加上 KL 正则来约束模型不要偏离原来的输出太远。

RLHF 不只是“再训练一次”,而是在算力边界里做取舍

RLHF 在算力里找平衡

RLHF 阶段把生成视频从 125 帧降到 29 帧,并且只解码首帧来节省开销。这个选择说明作者并不是追求最完整的训练信号,而是在有限内存里尽量保住最关键的优化方向。

同时,作者还用了动态分桶、gradient checkpointing、3D 并行、FSDP 和 HYBRIDSHARD 等方法来压低训练成本。实验里还提到,RoPE 只需约 500 步就能适配,但长训后在 VBench 上并没有明显超过 APE,所以最后并未替换 APE。

结果说明了什么:提升不只来自一个点

不同阶段补不同短板

在结果上,ContentV 的 VBench Overall 达到 85.14,论文摘要中称其为 state-of-the-art;与 CogVideoX-5B、HunyuanVideo-13B 相比,VBench 更高,人评也略优于 Wan2.1-14B。另一个关键信号是,它能支持多分辨率、多时长视频生成,并训练到 480P、24 FPS、5 秒视频。

更细的评估显示,SFT 主要把文本对齐拉高:Table 4 中 TA 从 0.8737 提升到 1.0145,win rate 为 61.31%。RLHF 更偏向整体质量:VQ 从 -0.2160 提升到 0.3034,win rate 为 89.38%。这里最重要的解释是,后训练并不是重复劳动,而是在不同阶段分别补上对齐和观感。

研究附录术语、来源与待验证问题

论文证据

高可信

这篇工作提出了一个名为 ContentV 的 8B 文本到视频模型,基于 Stable Diffusion 3.5 Large。

Page 1 / 方法部分:"提出 ContentV:基于 Stable Diffusion 3.5 Large 的 8B 文本到视频模型。"

高可信

作者用 3D-VAE 替换原有 VAE,并加入 3D 位置编码,以便快速把图像生成底座扩展到视频生成。

Page 1、Section 2:"用 3D-VAE 替换原 VAE,并加入 3D 位置编码,快速获得视频生成能力。"

高可信

模型采用多阶段训练流程,包括 flow matching 预训练、SFT 和 RLHF。

Page 1 / 方法部分、Section 3:"采用多阶段训练:flow matching 预训练、SFT、RLHF。"

高可信

数据侧建立了清洗与筛选流水线,包括分镜、去重、字幕/水印检测、模糊、运动动态和审美评分。

Page 1、Section 2:"构建数据清洗流水线:分镜、去重、字幕/水印检测、模糊、运动动态和审美评分。"

高可信

最终训练在 256 个 64GB NPU 上进行,持续 4 周,并达到 VBench 85.14。

Page 1 / 摘要与 Section 4:"在 256 个 64GB NPU 上训练 4 周,达到 VBench 85.14。"

高可信

作者报告该模型支持多分辨率、多时长视频生成,训练到 480P、24 FPS、5 秒视频。

Page 1 / 摘要:"支持多分辨率、多时长视频生成;训练到 480P、24 FPS、5 秒视频。"

高可信

评测中,ContentV 的 VBench 总分高于 CogVideoX-5B 和 HunyuanVideo-13B,人评略优于 Wan2.1-14B。

Page 1、Section 5:"相比 CogVideoX-5B 和 HunyuanVideo-13B,VBench 更高;人评略优于 Wan2.1-14B。"

能力边界与局限

  • 训练仍依赖 256 个 64GB NPU,资源门槛高。
  • 当前证据主要来自 VBench、人评和少量分项指标,失败案例不充分。
  • 数据流水线和训练策略较复杂,包含多阶段过滤与并行基础设施。
  • 未见完整消融结果来分解 3D-VAE、数据筛选、SFT 和 RLHF 的独立贡献。

和其他方案放在一起看

方案类型优势限制判断
CogVideoX-5B开源视频生成基线在文中对比里,ContentV 的 VBench 总分更高。提供的证据没有给出完整数值表和所有设置细节。ContentV 在作者报告的 VBench 对比中优于它。
HunyuanVideo-13B开源视频生成基线作为较大的公开视频模型,提供了强基线参照。文中只给出总体优于的结论,未展开细项原因。ContentV 在 VBench 上优于它。
Wan2.1-14B对比模型 / 商用或闭源系统在人类评估中是直接对比对象。证据只说“略优”,没有统计检验与完整偏好分布。ContentV 的人评表现略优。

还不能确定的地方

3D-VAE、数据筛选、SFT 和 RLHF 各自的独立贡献大小不清楚。

提供的证据摘要提到多阶段训练和多项改动,但没有完整消融矩阵。

查看正文中的消融实验表和各模块替换实验。

“四周训练”和“约一月训练”的时间口径是否完全一致不确定。

证据 notes 中出现了两种近似表述,未说明是否同一统计口径。

核对摘要、实验设置和训练日志中的精确时间定义。

与闭源或商用模型的对比设置细节不完整。

仅有“人评略优”的结论,没有完整样本量、统计检验和评分协议。

查阅人类评测的实验设计、样本规模与统计显著性说明。

VBench 85.14 是否在所有任务维度上都稳定领先仍待确认。

当前只看到总体分数,没有看到完整分项和方差。

检查 VBench 分项结果表以及不同提示集上的重复评测。

术语表

ContentV
论文提出的 8B 文本到视频模型,基于 Stable Diffusion 3.5 Large 做视频化改造。
Stable Diffusion 3.5 Large
作为底座复用的图像生成模型;论文在它的基础上加入视频所需的结构。
3D-VAE
三维变分自编码器,用来让模型把视频当作带时间维度的整体来编码和解码。
VBench
论文使用的视频生成评测基准,用来衡量整体生成质量。
SFT
监督微调(Supervised Fine-Tuning),用于把模型往更符合高质量数据的方向推。
RLHF
基于人类反馈的强化学习,这里用于继续提升生成质量和偏好一致性。
TA
Text Alignment,文本对齐程度,表示生成内容和提示词贴合得有多好。
VQ
Visual Quality,视觉质量,侧重画面观感和清晰度等因素。

参考来源

来源追踪

摘要 / Page 1: ContentV 是基于 Stable Diffusion 3.5 Large 的 8B 文本到视频模型。 arXiv PDF

摘要 / Page 1: 模型支持多分辨率、多时长视频生成,并训练到 480P、24 FPS、5 秒视频。 arXiv PDF

Section 2: 采用 3D-VAE、3D 位置编码、数据清洗流水线与多阶段训练。 arXiv PDF

Section 3: 训练流程包含 Stage1、Stage2、Stage3、SFT 和 RLHF。 arXiv PDF

Section 4: 在 256 个 NPU 上完成训练,并给出 64GB HBM、带宽和并行优化配置。 arXiv PDF

Section 5: VBench、VideoAlign 和用户研究用于评估各训练阶段与最终模型。 arXiv PDF

Section 5: ContentV 与 CogVideoX-5B、HunyuanVideo-13B、Wan2.1-14B 做了对比。 arXiv PDF

关于这篇论文的三个关键问题

ContentV:在256个64GB NPU上训练的8B文生视频模型 解决了什么问题?

这篇论文提出 ContentV:一个基于 Stable Diffusion 3.5 Large 的 8B 文本到视频模型,目标是在算力受限但又要追求高质量的条件下,把长视频训练做得更稳、更省、更可复用。

ContentV:在256个64GB NPU上训练的8B文生视频模型 的核心结论有哪些证据?

这篇工作提出了一个名为 ContentV 的 8B 文本到视频模型,基于 Stable Diffusion 3.5 Large。 Page 1 / 方法部分:"提出 ContentV:基于 Stable Diffusion 3.5 Large 的 8B 文本到视频模型。"

阅读 ContentV:在256个64GB NPU上训练的8B文生视频模型 时最需要注意什么局限?

当前证据主要来自 VBench、人评和少量分项指标,失败案例不充分。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro