AI / Technology
ContentV:在256个64GB NPU上训练的8B文生视频模型
这篇论文提出 ContentV:一个基于 Stable Diffusion 3.5 Large 的 8B 文本到视频模型,目标是在算力受限但又要追求高质量的条件下,把长视频训练做得更稳、更省、更可复用。
为什么不能直接沿用“先图像、后视频”的老路
视频生成比图像生成更吃显存,因为模型不仅要看“长什么样”,还要记住“前后怎么变”。当序列拉长、分辨率升高时,训练就很容易被内存和计算拖住。
论文把问题指向两件事:一是现有两阶段范式效率不够,二是低质量、重复的视频数据会把生成效果拉低。也就是说,困难不只在模型结构,还在数据和训练方式本身。
先把输入和底座改对,模型才有机会学会视频
ContentV 不从零开始,而是复用 Stable Diffusion 3.5 Large 的图像生成底座,再把其中的 2D-VAE 换成 3D-VAE,并加入 3D 位置编码。直观地说,这是把“只会看单张图”的骨架,改成能感知时间变化的骨架。
为了让训练数据更干净,作者先把视频切成剪辑,再做分镜、去重、字幕和水印检测、模糊与动态评分、审美评分等筛选。最终获得约 100 万条剪辑作为预训练数据。这里的关键不是多,而是尽量把重复、噪声和不一致的片段挡在外面。
为什么要分阶段训练,而不是一次把所有目标都塞进去
论文把训练拆成几个阶段:先学基础的视频表征,再逐步加入更长、更高分辨率的序列,最后用 SFT 和 RLHF 把质量往上推。这样做的理由很现实:如果一开始就让模型面对最难的长视频任务,训练更容易不稳定。
文中给出的配置是 Stage1 5k 步、Stage2 40k 步、Stage3 60k 步、SFT 5k 步。作者还提到,Stage2 主要负责学到动态视觉表征,所以分配了大部分算力。SFT 阶段把学习率降到预训练的 10%,并加上 KL 正则来约束模型不要偏离原来的输出太远。
RLHF 不只是“再训练一次”,而是在算力边界里做取舍
RLHF 阶段把生成视频从 125 帧降到 29 帧,并且只解码首帧来节省开销。这个选择说明作者并不是追求最完整的训练信号,而是在有限内存里尽量保住最关键的优化方向。
同时,作者还用了动态分桶、gradient checkpointing、3D 并行、FSDP 和 HYBRIDSHARD 等方法来压低训练成本。实验里还提到,RoPE 只需约 500 步就能适配,但长训后在 VBench 上并没有明显超过 APE,所以最后并未替换 APE。
结果说明了什么:提升不只来自一个点
在结果上,ContentV 的 VBench Overall 达到 85.14,论文摘要中称其为 state-of-the-art;与 CogVideoX-5B、HunyuanVideo-13B 相比,VBench 更高,人评也略优于 Wan2.1-14B。另一个关键信号是,它能支持多分辨率、多时长视频生成,并训练到 480P、24 FPS、5 秒视频。
更细的评估显示,SFT 主要把文本对齐拉高:Table 4 中 TA 从 0.8737 提升到 1.0145,win rate 为 61.31%。RLHF 更偏向整体质量:VQ 从 -0.2160 提升到 0.3034,win rate 为 89.38%。这里最重要的解释是,后训练并不是重复劳动,而是在不同阶段分别补上对齐和观感。
研究附录术语、来源与待验证问题
论文证据
这篇工作提出了一个名为 ContentV 的 8B 文本到视频模型,基于 Stable Diffusion 3.5 Large。
Page 1 / 方法部分:"提出 ContentV:基于 Stable Diffusion 3.5 Large 的 8B 文本到视频模型。"
作者用 3D-VAE 替换原有 VAE,并加入 3D 位置编码,以便快速把图像生成底座扩展到视频生成。
Page 1、Section 2:"用 3D-VAE 替换原 VAE,并加入 3D 位置编码,快速获得视频生成能力。"
模型采用多阶段训练流程,包括 flow matching 预训练、SFT 和 RLHF。
Page 1 / 方法部分、Section 3:"采用多阶段训练:flow matching 预训练、SFT、RLHF。"
数据侧建立了清洗与筛选流水线,包括分镜、去重、字幕/水印检测、模糊、运动动态和审美评分。
Page 1、Section 2:"构建数据清洗流水线:分镜、去重、字幕/水印检测、模糊、运动动态和审美评分。"
最终训练在 256 个 64GB NPU 上进行,持续 4 周,并达到 VBench 85.14。
Page 1 / 摘要与 Section 4:"在 256 个 64GB NPU 上训练 4 周,达到 VBench 85.14。"
作者报告该模型支持多分辨率、多时长视频生成,训练到 480P、24 FPS、5 秒视频。
Page 1 / 摘要:"支持多分辨率、多时长视频生成;训练到 480P、24 FPS、5 秒视频。"
评测中,ContentV 的 VBench 总分高于 CogVideoX-5B 和 HunyuanVideo-13B,人评略优于 Wan2.1-14B。
Page 1、Section 5:"相比 CogVideoX-5B 和 HunyuanVideo-13B,VBench 更高;人评略优于 Wan2.1-14B。"
能力边界与局限
- 训练仍依赖 256 个 64GB NPU,资源门槛高。
- 当前证据主要来自 VBench、人评和少量分项指标,失败案例不充分。
- 数据流水线和训练策略较复杂,包含多阶段过滤与并行基础设施。
- 未见完整消融结果来分解 3D-VAE、数据筛选、SFT 和 RLHF 的独立贡献。
和其他方案放在一起看
还不能确定的地方
3D-VAE、数据筛选、SFT 和 RLHF 各自的独立贡献大小不清楚。
提供的证据摘要提到多阶段训练和多项改动,但没有完整消融矩阵。
查看正文中的消融实验表和各模块替换实验。
“四周训练”和“约一月训练”的时间口径是否完全一致不确定。
证据 notes 中出现了两种近似表述,未说明是否同一统计口径。
核对摘要、实验设置和训练日志中的精确时间定义。
与闭源或商用模型的对比设置细节不完整。
仅有“人评略优”的结论,没有完整样本量、统计检验和评分协议。
查阅人类评测的实验设计、样本规模与统计显著性说明。
VBench 85.14 是否在所有任务维度上都稳定领先仍待确认。
当前只看到总体分数,没有看到完整分项和方差。
检查 VBench 分项结果表以及不同提示集上的重复评测。
术语表
- ContentV
- 论文提出的 8B 文本到视频模型,基于 Stable Diffusion 3.5 Large 做视频化改造。
- Stable Diffusion 3.5 Large
- 作为底座复用的图像生成模型;论文在它的基础上加入视频所需的结构。
- 3D-VAE
- 三维变分自编码器,用来让模型把视频当作带时间维度的整体来编码和解码。
- VBench
- 论文使用的视频生成评测基准,用来衡量整体生成质量。
- SFT
- 监督微调(Supervised Fine-Tuning),用于把模型往更符合高质量数据的方向推。
- RLHF
- 基于人类反馈的强化学习,这里用于继续提升生成质量和偏好一致性。
- TA
- Text Alignment,文本对齐程度,表示生成内容和提示词贴合得有多好。
- VQ
- Visual Quality,视觉质量,侧重画面观感和清晰度等因素。
参考来源
来源追踪
摘要 / Page 1: ContentV 是基于 Stable Diffusion 3.5 Large 的 8B 文本到视频模型。 arXiv PDF
摘要 / Page 1: 模型支持多分辨率、多时长视频生成,并训练到 480P、24 FPS、5 秒视频。 arXiv PDF
Section 2: 采用 3D-VAE、3D 位置编码、数据清洗流水线与多阶段训练。 arXiv PDF
Section 3: 训练流程包含 Stage1、Stage2、Stage3、SFT 和 RLHF。 arXiv PDF
Section 4: 在 256 个 NPU 上完成训练,并给出 64GB HBM、带宽和并行优化配置。 arXiv PDF
Section 5: VBench、VideoAlign 和用户研究用于评估各训练阶段与最终模型。 arXiv PDF
Section 5: ContentV 与 CogVideoX-5B、HunyuanVideo-13B、Wan2.1-14B 做了对比。 arXiv PDF
关于这篇论文的三个关键问题
ContentV:在256个64GB NPU上训练的8B文生视频模型 解决了什么问题?
这篇论文提出 ContentV:一个基于 Stable Diffusion 3.5 Large 的 8B 文本到视频模型,目标是在算力受限但又要追求高质量的条件下,把长视频训练做得更稳、更省、更可复用。
ContentV:在256个64GB NPU上训练的8B文生视频模型 的核心结论有哪些证据?
这篇工作提出了一个名为 ContentV 的 8B 文本到视频模型,基于 Stable Diffusion 3.5 Large。 Page 1 / 方法部分:"提出 ContentV:基于 Stable Diffusion 3.5 Large 的 8B 文本到视频模型。"
阅读 ContentV:在256个64GB NPU上训练的8B文生视频模型 时最需要注意什么局限?
当前证据主要来自 VBench、人评和少量分项指标,失败案例不充分。