返回报告库

AI / Technology

Jukebox一个音乐生成模型

四分钟原始音频先被压缩成离散音乐代码

图 1|为什么要先压缩。四分钟、44.1 kHz 的音频约有一千万个采样点;直接逐点建模,很难同时顾及音色和跨分钟结构。[§2]

  1. 它生成的是最终声音,不是乐谱。 因而能同时处理旋律、节奏、乐器音色和歌声,但也必须面对海量波形采样点。[§1–2]
  2. 它把难题拆成三层。 顶层管较长时间的音乐走向,中层和底层逐步补回声音细节。[§3–4]
  3. 它展示了多分钟生成,却没有解决整曲结构。 作者明确说,模型通常不会让副歌或旋律在很久之后准确重现。[§5.3;§7]

Jukebox 从原始音频到带歌声音频的完整生成链路

图 2|完整链路。先压缩,顶层逐个生成粗代码,再由两个上采样器补回中层和底层代码,最后解码成波形。[§4;图 2]

论文没有照搬单个层级式自动编码器,因为底层通道会让顶层几乎闲置。作者改为分别训练三套自动编码器,并在代码长期不用时把它重置到当前编码器输出附近;多分辨率频谱损失则帮助模型保留中高频。[§3.1–3.3]

同样长度的代码上下文在三层对应不同真实时长

图 3|同样是 8192 个代码,压缩越强,覆盖的真实音频越长。这里的 24、6、1.5 秒来自论文训练配置。[§5.2]

三个 Transformer 都读取 8192 个代码,但这些代码对应的真实时长不同:顶层约 24 秒,中层约 6 秒,底层约 1.5 秒。顶层因此能在相近计算量下看得更远;中、底层只需依据上层结果补回更细的声音。[§4;§5.2]

录音棚类比:先定结构,再做编配,最后补声音细节

图 4|直觉类比。它像先搭歌曲段落,再做编配,最后进入录音层面的细化;这是帮助理解的类比,不是作者对内部表征的逐项命名。

图 3|同样是 8192 个代码,压缩越强,覆盖的真实音频越长。这里的 24、6、1.5 秒来自论文训练配置。[§5.2]

相邻窗口能保持局部连贯,但很远的段落不会被可靠记住

图 5|局部连贯不等于全局结构。重叠窗口让相邻片段接得上,却没有给顶层提供整首歌的记忆;右侧沙漏和杂音符号也对应慢速采样与偶发噪声。[§4.4;§7]

作者观察到,约 24 秒的顶层上下文内通常较连贯,滑窗后音色与和声也能延续;然而模型看不到整首歌,所以通常不会重现副歌,也缺少人类旋律常见的问答式结构。生成旋律也被作者评价为通常不如人类作品有趣。[§5.3;§7]

研究附录

官方标题: Jukebox: A Generative Model for Music
作者: Prafulla Dhariwal、Heewoo Jun、Christine Payne、Jong Wook Kim、Alec Radford、Ilya Sutskever
来源: arXiv:2005.00341,2020 年 4 月 30 日提交

核心结论

Jukebox 证明了一条当时很大胆的路线:模型可以不先写 MIDI,也不把歌声和伴奏拆开,而是直接生成包含人声的原始音频。它先把极长的波形压成三层离散代码,再用自回归 Transformer 从粗到细地补回音乐。代价是训练和生成都非常昂贵,而且“能唱几分钟”不等于“记得整首歌的结构”。[摘要;§1;§8]

记住这三点

  1. 它生成的是最终声音,不是乐谱。 因而能同时处理旋律、节奏、乐器音色和歌声,但也必须面对海量波形采样点。[§1–2]
  2. 它把难题拆成三层。 顶层管较长时间的音乐走向,中层和底层逐步补回声音细节。[§3–4]
  3. 它展示了多分钟生成,却没有解决整曲结构。 作者明确说,模型通常不会让副歌或旋律在很久之后准确重现。[§5.3;§7]

问题

四分钟音频不是“一段”,而是一千万个决定

原始音频是一串连续振幅。论文举例说,四分钟、44.1 kHz 的音频约有一千万个位置;相比之下,1024×1024 的 RGB 图像约有三百万个位置。模型既要处理每个瞬间的音色,又要让几分钟前后的段落保持关系,计算量会迅速失控。[§2, p.2]

过去的方法常把最难的部分先拿掉

符号音乐模型生成音高、时长、力度和乐器等事件,问题更小,却受限于固定的音符与渲染方式。早期原始音频或频谱方法能生成钢琴或短器乐片段,但论文把长距离依赖视为主要瓶颈。Jukebox 选择保留最终声音,同时先学习一种更短的表示。[§1;§7]

方法

第一步:把声音压成三层“音乐代码”

可以先把每小段声音想成一本代码字典中的一个编号。模型用三个独立的 VQ-VAE,把 44.1 kHz 音频分别压缩 8 倍、32 倍和 128 倍;每层有 2048 个可选代码。压得越狠,单个代码覆盖的时间越长,但丢掉的声音细节也越多。[§3;§5.2;表 1–3]

论文没有照搬单个层级式自动编码器,因为底层通道会让顶层几乎闲置。作者改为分别训练三套自动编码器,并在代码长期不用时把它重置到当前编码器输出附近;多分辨率频谱损失则帮助模型保留中高频。[§3.1–3.3]

第二步:先想较长的走向,再补局部细节

三个 Transformer 都读取 8192 个代码,但这些代码对应的真实时长不同:顶层约 24 秒,中层约 6 秒,底层约 1.5 秒。顶层因此能在相近计算量下看得更远;中、底层只需依据上层结果补回更细的声音。[§4;§5.2]

第三步:用风格、时间和歌词给生成加方向

艺术家和流派标签控制整体风格;歌曲总时长、片段起点和已完成比例帮助模型学会开头、过渡与结尾。歌词没有逐字时间戳,模型要自己把文本和演唱对齐。论文展示的注意力图表明,某些层确实学到了随演唱位置移动的文字对齐。[§4.1–4.3;图 3]

生成时,模型先逐个采样顶层代码,再依次采样中层和底层。要超过 24 秒,它就把窗口向前滑动一半,并用重叠部分承接下一段;也可以先输入 12 秒真实歌曲,再续写新的音乐。[§4.4;§5.3]

证据与局限

压缩模块有可核对的消融结果

作者在 5000 个留出的三秒音频片段上测量频谱收敛误差。底层压缩 8 倍时,使用代码重启的结果为 −23.0 dB;顶层压缩 128 倍时为 −8.3 dB,说明更强压缩会牺牲重建保真度。顶层去掉频谱损失后从 −8.3 dB 变为 −6.3 dB;改用单个层级式自动编码器则变为 2.9 dB,重建明显恶化。[§6;表 1、3]

代码本也有清晰的容量取舍:底层使用 2048 个代码时为 −23.0 dB,缩到 256 个代码时为 −15.9 dB;取消量化瓶颈可到 −40.5 dB。也就是说,离散压缩让后续生成变得可做,但信息损失是真实存在的。[§6;表 2]

整首歌的结论主要来自人工听评

论文没有报告标准化听众研究、均值意见分或与强基线的大规模盲测。作者说明音乐体验主观,因此手工检查连贯性、音乐性、多样性和新颖性,并公开大量样本。样本显示模型能生成多种流派、可辨认的歌声和多分钟片段;但这更像能力展示,不能据此精确判断它比其他系统好多少。[§5.3]

作者观察到,约 24 秒的顶层上下文内通常较连贯,滑窗后音色与和声也能延续;然而模型看不到整首歌,所以通常不会重现副歌,也缺少人类旋律常见的问答式结构。生成旋律也被作者评价为通常不如人类作品有趣。[§5.3;§7]

规模、数据和速度都是重要限制

数据集来自抓取的 120 万首歌曲,其中 60 万首为英语;歌词与元数据来自 LyricWiki。论文没有在正文中给出授权、去重和训练集记忆的系统审计,因此数据来源、权利边界和复现条件仍不清楚。[§5.1;不确定性:论文未报告完整数据治理审计]

顶层先验有 50 亿参数,用 512 张 V100 训练四周;每个上采样器有 10 亿参数,用 128 张 V100 训练两周。生成一分钟顶层代码约需一小时,再上采样约需八小时。作者还指出偶尔会听到噪声或刮擦感,歌词对齐在 hip-hop、rap 等类型中也更容易失败。[§5.2;§5.3;§7]

实际意义

真正的贡献是把“最终声音”纳入同一个生成系统

Jukebox 把作曲、编配、音色和演唱放进同一条原始音频生成链路,减少了对 MIDI、分轨或手工声学特征的依赖。对研究者来说,它验证了“离散音频表示 + 大型序列模型 + 逐层解码”能跨越分钟尺度;对产品团队来说,它展示了歌词、风格和音频开头可以成为不同层次的控制入口。[§1;§4;§8]

它更像昂贵的创意探索器,不像即时作曲工具

论文设想让人先听顶层的粗糙结果,从多个分支中挑一个,再继续生成。这个交互思路适合续写 riff、探索不同发展方向,却受九小时级生成延迟拖累。若做产品原型,最先要验证的不是“能否出声”,而是等待时间、控制是否稳定、结果是否能编辑,以及训练数据与声音模仿的权利边界。[§5.3;§7;产品含义为本文解释]

阅读附录:术语、来源和待验证问题

  • VQ-VAE: 把连续声音片段映射到有限代码本中的离散编号,再解码回音频。Jukebox 分别训练三种压缩尺度。[§2.1;§3]
  • 自回归生成: 每次根据先前代码预测下一个代码。它便于建模顺序,却让采样必须串行进行。[§4.4;§7]
  • 频谱收敛: 论文用频谱误差相对信号大小来衡量重建;数值越负,误差越小。它只验证重建模块,不等同于整首歌的主观质量。[§6]
  • 最需要补的实验: 标准化盲听、与同期强基线的同条件比较、训练数据记忆与近重复检测、跨语言测试、速度与质量的系统权衡。前四项在论文中没有完整报告。[§5–7]
  • 核对入口: 论文摘要页;正文重点见 §3–4(方法)、§5–6(实验与消融)、§7(局限)。

关于这篇论文的三个关键问题

Jukebox:一个音乐生成模型 解决了什么问题?

原始音频是一串连续振幅。论文举例说,四分钟、44.1 kHz 的音频约有一千万个位置;相比之下,1024×1024 的 RGB 图像约有三百万个位置。模型既要处理每个瞬间的音色,又要让几分钟前后的段落保持关系,计算量会迅速失控。[§2, p.2]

Jukebox:一个音乐生成模型 的核心结论有哪些证据?

作者在 5000 个留出的三秒音频片段上测量频谱收敛误差。底层压缩 8 倍时,使用代码重启的结果为 −23.0 dB;顶层压缩 128 倍时为 −8.3 dB,说明更强压缩会牺牲重建保真度。顶层去掉频谱损失后从 −8.3 dB 变为 −6.3 dB;改用单个层级式自动编码器则变为 2.9 dB,重建明显恶化。[§6;表 1、3]

阅读 Jukebox:一个音乐生成模型 时最需要注意什么局限?

论文没有报告标准化听众研究、均值意见分或与强基线的大规模盲测。作者说明音乐体验主观,因此手工检查连贯性、音乐性、多样性和新颖性,并公开大量样本。样本显示模型能生成多种流派、可辨认的歌声和多分钟片段;但这更像能力展示,不能据此精确判断它比其他系统好多少。[§5.3]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro