AI / Technology
谱继承:把RLVR更新拆成“保留基谱、只学框架”
这篇工作研究的是一种很具体的后训练问题:在强化学习式的可验证奖励训练(RLVR)里,模型权重到底是怎么被改写的,以及能不能把“该保留什么”和“该学习什么”分开。作者的主张是,RLVR里很多检查点都接近基模型的固定谱家族,也就是奇异值结构几乎不变,但左右“框架”会继续适应。
RLVR 为什么需要新的参数化
RLVR 的目标不是单纯拟合标签,而是让模型根据奖励信号学会更好的输出。这里真正麻烦的地方不在“有没有奖励”,而在“奖励反馈最后是怎样变成权重更新的”。如果只看普通欧氏坐标,很难分清模型是在复用原来的结构,还是在重新塑形整个权重。
作者指出,现有优化器和参数化大多还是沿用预训练阶段的做法,这在 RLVR 场景里不够贴合。于是问题变成:能不能找一种表示方式,把“已经学到的稳定部分”保留下来,只让真正需要适应的部分继续更新。
直接在权重空间做 RL 更新
最常见的做法是沿着标准优化器更新整个权重矩阵,比如 AdamW 或 Muon 直接作用在参数上。这样实现方便,但它默认权重空间就是合适的工作坐标,不会主动区分“基座结构”与“任务适应”。
作者的对比结果里,这种做法能工作,但在一些设置下不如固定谱坐标中的 ISO 训练收敛快,或者需要更多步数才能到达类似水平。
谱继承:先固定基谱,再学习框架
作者提出的基本表示是固定谱参数化:把权重写成 (W(U,V)=U\Sigma0V^\top)。这里 (\Sigma0) 是从基模型继承来的固定奇异值,(U) 和 (V) 是还可以学习的框架变量。
平常可以把它理解成:房子的地基先不动,装修和内部布局继续改。这样做的目的不是缩小模型能表示的内容,而是把训练限制在作者认为更有结构的那部分变化上。
ISO-Optimizer:把现有优化器搬到框架变量上
ISO-Optimizer 不是先在整个权重上更新,再把结果投回固定谱族;它是直接在 (U,V) 这些框架坐标里运行 AdamW 或 Muon,再用 polar retraction 保证变量仍然可行。这里的 everyday 直觉是:先在允许活动的轨道里走,再把姿态校正回来。
作者报告,在 Qwen3-8B-Base 上,AdamW 270 步达到 0.495;ISO-AdamW 100 步就达到同样 0.495,210 步进一步到 0.509。另一个结果里,Qwen3-4B-Base 上 ISO-Muon 也优于普通 Muon。
这些证据,能把结论推到哪一步
这篇论文研究的是 RLVR(基于奖励的视觉/推理强化学习)中,权重更新为什么会表现出近似保谱(near-isospectrality),以及能否把“保持基谱、只学习框架”做成一种原生优化与合并方法。
作者提出 spectral inheritance 与 Isospectral Optimization(ISO):复用基模型权重谱,只优化输入/输出奇异框架(singular frame),把可学习变化放到框架变量上。
作者给出 ISO-Merger,用于把共享基座的多个 RLVR 专家做 checkpoint 级合并;论文明确说明它不需要 post-merge 数据、rollout、梯度更新或蒸馏。
近 isospectrality 目前只是对所分析矩阵的描述性事实,不等于证明优化器存在内在的保谱偏好。
在线训练路径:ISO-AdamW / ISO-Muon
如果你的任务是继续训练一个 RLVR 检查点,最小闭环就是:拿到基模型权重,固定基谱,只更新框架变量,最后再重构出新的权重。这样每一步都还在固定谱族里。
作者给出的证据包括:Qwen3-1.7B-Base 上 ISO-AdamW 的平均分高于普通 AdamW 和 Muon;Qwen3-8B-Base 上 ISO-AdamW 也能更快到达较高分数。这里更像是一个训练接口改造,而不是换掉所有优化器理论。
- 输入:共享基模型或其 RLVR 检查点。
- 处理:固定 (\Sigma0),在 (U,V) 上做优化并做重构校正。
- 输出:仍属于固定谱族的新权重,但框架已被任务信号更新。
研究附录术语、来源与待验证问题
论文证据
这篇论文研究的是 RLVR(基于奖励的视觉/推理强化学习)中,权重更新为什么会表现出近似保谱(near-isospectrality),以及能否把“保持基谱、只学习框架”做成一种原生优化与合并方法。
PDF text / Page 4:问题部分明确写到“RLVR 的优化层如何把奖励反馈转化为权重更新,尚不清楚”“需要区分 RLVR 中‘复用什么’与‘改变什么’”。
作者提出 spectral inheritance 与 Isospectral Optimization(ISO):复用基模型权重谱,只优化输入/输出奇异框架(singular frame),把可学习变化放到框架变量上。
PDF text / Page 11:方法部分写明“ISO用固定谱参数化 W(U,V)=U Σ0 V⊤,其中 U、V 位于 Stiefel 流形”。
作者给出 ISO-Merger,用于把共享基座的多个 RLVR 专家做 checkpoint 级合并;论文明确说明它不需要 post-merge 数据、rollout、梯度更新或蒸馏。
PDF text / Page 11:方法部分写明“ISO-Merger:只用 checkpoint 合并共享基座专家,不需 post-merge 数据、rollout 或 distillation”。
作者给出 ISO-Optimizer,把 AdamW 或 Muon 作用到帧变量 (U,V) 上,同时保持基谱不变,并用 polar retraction 恢复可行性。
PDF text / Page 11:方法部分写明“ISO-Optimizer:把 AdamW 或 Muon 等基础优化器作用到帧变量 (U,V),再用 polar retraction 恢复可行性”。
在 Qwen3-8B-Base 上,AdamW 270 步达到 0.495;ISO-AdamW 100 步达到同样 0.495,210 步进一步到 0.509。
PDF text / Page 4 与 Page 18:实验部分给出该数值对比。
在 DeepSeek-R1-Distill-Qwen-1.5B 的 RLVR 端点上,后 RL 谱几乎重合前 RL 基座;而 SFT 转换出现明显谱收缩。
PDF text / Page 4:实验描述明确给出 RLVR 与 SFT 的谱对比。
在作者报告的样本中,RLVR 轨迹的谱距离指标很小:δΣ 约为 10^-2%,相对谱残差 ρΣ 平均约 3%;Figure 3 还写到 δΣ(t) 始终低于 10^-5。
PDF text / Page 7:Figure 3 与对应说明给出 δΣ、ρΣ 与轨迹结果。
实验表明,恢复基座谱同时保留 RL 帧,可以保留大部分端点性能;而只更新奇异值的对照提升有限。
PDF text / Page 4 与 Page 21:恢复基谱、保留 RL 帧保留大部分收益;spectrum-only 训练恢复有限。
能力边界与局限
- 近 isospectrality 目前只是对所分析矩阵的描述性事实,不等于证明优化器存在内在的保谱偏好。
- 论文主要覆盖若干 reasoning 与 coding 任务,模型规模在 1.5B 到 8B 之间,外推范围有限。
- 端点比较不能排除训练中间出现过较大谱波动后又抵消的可能。
- ISO-Merger 与 ISO-Optimizer 的收益仍与共享基座、参数化选择和具体 recipe 绑定。
- 作者明确提到,系统比较权重空间中的谱保持优化器与因子空间 ISO 仍留待未来工作。
和其他方案放在一起看
还不能确定的地方
near-isospectrality 是否是 RLVR 的普遍结构,而不是仅限于本文分析的矩阵和任务。
论文给出的证据主要覆盖少数模型和若干 reasoning / coding 任务,尚未做更广泛分布验证。
在更多模型、更多数据分布和不同奖励形态上重复端点与轨迹谱分析。
ISO 的收益有多少来自固定谱本身,有多少来自 Stiefel 参数化与具体优化器组合。
文段报告了整体效果,但没有把这些因素完全拆开做消融归因。
分别固定谱、只改参数化、只改优化器,并做完整消融实验。
端点相近是否掩盖了训练过程中的大幅谱波动。
作者自己指出端点比较不能排除中间大幅波动后抵消的可能。
对更密集的训练轨迹做全程谱追踪,而不只看起点和终点。
ISO-Merger 的优势是否对所有共享基座专家合并场景都成立。
论文明确只研究从同一 base checkpoint 微调来的专家。
在不同共享基座深度、不同任务重叠度和不同专家数下复现实验。
论文中报告的重牵引、状态开销和 2.2× / 2.7× 步数节省是否可稳定迁移到其他设置。
这些数字来自特定模型、任务和训练剖面。
在不同模型尺寸、GPU 配置和 RLVR recipe 下重新测量吞吐与收敛速度。
术语表
- RLVR(强化学习式可验证奖励训练)
- 一种用可验证的奖励信号训练模型的方法,常见于推理、代码等能自动检查对错的任务。
- 谱 / 奇异值
- 把矩阵拆解后得到的稳定尺度信息。本文把它看成更像“骨架”的部分。
- 基谱
- 从基模型继承来的固定奇异值集合,ISO 中不在训练时改动。
- 框架变量
- 这里指奇异值分解里的左右因子 (U,V),它们是训练时继续适应的部分。
- spectral inheritance(谱继承)
- 把基模型的谱结构直接复用到后训练中,只让框架承接任务变化。
- ISO(Isospectral Optimization)
- 本文提出的固定谱优化框架,在保持基谱不变的同时更新框架变量。
- ISO-Merger
- 一种只基于检查点、在共享基谱坐标里合并多个专家的方法。
- polar retraction
- 把更新后的框架拉回可行集合的校正步骤,保证参数仍满足所需几何约束。
参考来源
来源追踪
Page 4: RLVR 的优化层如何把奖励反馈转化为权重更新尚不清楚;作者提出 spectral inheritance 与 ISO。 PDF text
Page 4: Qwen3-8B-Base 上 AdamW 270 步 0.495;ISO-AdamW 100 步 0.495,210 步 0.509。 PDF text
Page 4: DeepSeek-R1-Distill-Qwen-1.5B 的 RLVR 端点谱几乎重合前 RL 基座;SFT 显示明显谱收缩。 PDF text
Page 7: Figure 3 给出 δΣ(t) 始终低于 10^-5,ρΣ(t) 约为总位移的 1.3%。 PDF text
Page 11: 式 (15)、(19)、(28)-(31)、(33)-(36) 定义固定谱族、ISO-Merger、ISO-Optimizer 及其可行性恢复。 PDF text
Page 15: Qwen2.5-7B 与 DeepSeek-R1-Distill-Qwen-1.5B 上,ISO-Merger 的总体平均优于最强训练免费基线。 PDF text
Page 18: DS-1.5B、Qwen3-4B-Base、Qwen3-8B-Base 上的 ISO-AdamW / ISO-Muon 对照结果与步数效率。 PDF text
Page 21: 作者总结 ISO 作为统一的谱继承原则,且指出更一般的强制机制和其他应用仍是开放方向。 PDF text
关于这篇论文的三个关键问题
谱继承:把RLVR更新拆成“保留基谱、只学框架” 解决了什么问题?
RLVR 的目标不是单纯拟合标签,而是让模型根据奖励信号学会更好的输出。这里真正麻烦的地方不在“有没有奖励”,而在“奖励反馈最后是怎样变成权重更新的”。如果只看普通欧氏坐标,很难分清模型是在复用原来的结构,还是在重新塑形整个权重。
谱继承:把RLVR更新拆成“保留基谱、只学框架” 的核心结论有哪些证据?
这篇论文研究的是 RLVR(基于奖励的视觉/推理强化学习)中,权重更新为什么会表现出近似保谱(near-isospectrality),以及能否把“保持基谱、只学习框架”做成一种原生优化与合并方法。 PDF text / Page 4:问题部分明确写到“RLVR 的优化层如何把奖励反馈转化为权重更新,尚不清楚”“需要区分 RLVR 中‘复用什么’与‘改变什么’”。
阅读 谱继承:把RLVR更新拆成“保留基谱、只学框架” 时最需要注意什么局限?
近 isospectrality 目前只是对所分析矩阵的描述性事实,不等于证明优化器存在内在的保谱偏好。