返回报告库

AI / Technology

ISO:把 RLVR 训练改写成“固定谱、优化奇异帧”

这篇论文在问一个很具体的问题:强化学习式后训练(RLVR)到底是在改模型的哪一部分。作者发现,很多 RLVR 检查点和基座模型在“奇异值谱”上非常接近,真正承载变化的,更多是两侧的奇异帧(singular frames)。

RLVR 后训练为什么会让人困惑

为什么 RLVR 优化层值得重看

RLVR 的目标是让模型在推理、代码等任务上更会“做题”。问题是,训练时奖励信号到底怎样变成权重变化,并不清楚。

  • 人们通常能看到性能变好,但不容易说清楚模型内部到底改了什么。
  • 作者特别关心:权重里哪些结构在保留,哪些结构在变化。

直接在原权重空间里继续优化

直接在权重空间更新会看不见结构

最直观的做法,是把 RLVR 当成普通微调,继续用 AdamW 或 Muon 去改所有权重。这样做的好处是实现直接,但它默认模型应该在整个参数空间里自由漂移。

  • 优点是通用,缺点是难以利用“谱大体不变”这个结构。
  • 在作者报告的对比里,这类做法需要更多步数才能到达相近精度。

把模型写成固定谱的参数化

ISO 的固定谱参数化

ISO 的核心改法是:保留基矩阵的谱,只让两个奇异帧变化。可以把它理解成,强度分布先固定,之后只调整方向。

形式上,模型被写成 W(U,V)=UΣ₀Vᵀ,其中 Σ₀ 是基座模型的谱,U 和 V 是可训练的帧。这样做的目的不是缩小模型能力,而是把变化限制在作者认为真正承载 RLVR 收益的部分。

在线版本:ISO-Optimizer

ISO-Merger 与 ISO-Optimizer 的分工

在线训练时,ISO-Optimizer 只在 U、V 上做优化,优化器可以是 AdamW 或 Muon。每次更新后,还要做一次 polar retraction,把结果拉回固定谱坐标里。

这意味着训练不再是“随便改权重”,而是“在固定谱流形上走一步,再投回去”。在报告的实验里,这种做法在更少步数下达到了和普通优化器相近或更好的准确率。

  • 输入:基座谱、当前帧、RLVR 训练信号。
  • 输出:更新后的帧,以及保持不变的谱。

这些证据,能把结论推到哪一步

实验支持了什么,没支持什么

本文提出了一个面向 RLVR(reinforcement learning with verifiable rewards)的优化栈 ISO,把优化问题改写为“固定权重谱、只更新奇异帧”的参数化方式。

作者报告,未约束 RLVR 检查点通常接近基座权重的 fixed-spectrum family(near-isospectrality),而不是发生大幅谱变化。

在 DeepSeek-R1-Distill-Qwen-1.5B 的 >3,000 次更新端点上,RL 后谱几乎与 RL 前基模型重叠;而 SFT 的谱漂移明显更大。

结果主要来自作者报告的特定训练配置与检查点。

ISO-Optimizer 的小循环

把 ISO 放进训练流水线时会发生什么

最小闭环可以概括为:先拿到基座谱和当前帧,再接收一批 RLVR 训练信号,随后只更新帧变量,最后做 retraction,把参数拉回固定谱形式。

这个闭环的关键不是更大模型,而是更少自由度。作者报告的结果显示,在 Qwen3-8B-Base 上,ISO-AdamW 100 步就能达到 AdamW 270 步的同一准确率 0.495,210 步还能升到 0.509。

  • 输入少:只动帧,不动谱。
  • 反馈快:同样的目标可以用更少步数逼近。
研究附录术语、来源与待验证问题

论文证据

高可信

本文提出了一个面向 RLVR(reinforcement learning with verifiable rewards)的优化栈 ISO,把优化问题改写为“固定权重谱、只更新奇异帧”的参数化方式。

method 段:提出 spectral inheritance;将其形式化为 Isospectral Optimization (ISO),包括离线 ISO-Merger 和在线 ISO-Optimizer。

高可信

作者报告,未约束 RLVR 检查点通常接近基座权重的 fixed-spectrum family(near-isospectrality),而不是发生大幅谱变化。

Paper section 3:未约束 RLVR 的检查点通常接近基座权重的 fixed-spectrum family,称 near-isospectrality;图2 中 δΣ 约为 10^-2% 量级,ρΣ 平均约 3%。

高可信

在 DeepSeek-R1-Distill-Qwen-1.5B 的 >3,000 次更新端点上,RL 后谱几乎与 RL 前基模型重叠;而 SFT 的谱漂移明显更大。

Paper section 3:在 DeepSeek-R1-Distill-Qwen-1.5B 的 >3,000 次更新端点上,RL 后谱几乎与基模型重叠;图2 中 RLVR 的 δΣ 约 10^-2% 量级、ρΣ 平均约 3%,SFT 约 35%。

高可信

ISO-Optimizer 在 Qwen3-8B-Base 上以更少步数达到与 AdamW 相同或更高的准确率。

摘要与 section 7:Qwen3-8B-Base 上,AdamW 270 步达 0.495;ISO-AdamW 100 步达同样 0.495,210 步进一步达到 0.509;section 7 说明约减少 2.7 倍训练步数。

高可信

ISO-Merger 在所比较的数据自由合并方法中取得了更强的总体表现,且不依赖 post-merge 数据、rollouts、gradient updates 或 distillation。

摘要与 section 5/6:ISO-Merger 在对比的数据自由合并方法中取得了最强的总体表现;文中说明 ISO-Merger 不需要 post-merge 数据、rollouts、gradient updates 或 distillation。

高可信

在 Qwen2.5-7B 和 DeepSeek-R1-Distill-Qwen-1.5B 上,ISO-Merger 的平均结果高于最强无训练合并基线。

section 6:Qwen2.5-7B 上 ISO-Merger 平均 63.80,高于最强无训练合并基线 62.88;DeepSeek-R1-Distill-Qwen-1.5B 上 ISO-Merger 平均 44.38,高于最强基线 43.52。

高可信

ISO 的在线优化需要额外的 polar retraction 开销,但作者报告其约占端到端 step time 的 7%。

section 6:retraction 开销约占端到端 step time 的 7%。

能力边界与局限

  • 结果主要来自作者报告的特定训练配置与检查点。
  • 摘要未给出完整任务清单、统计显著性或置信区间。
  • ISO-Merger 仅在共享基座专家、checkpoint-only 的设定下报告。
  • ISO 的额外开销来自 SVD-based polar retraction,部署成本需要结合系统环境判断。
  • 作者明确表示该方法是归纳偏置,不是对所有 RLVR 场景的严格定律。

和其他方案放在一起看

方案类型优势限制判断
AdamW在线优化器基线在 Qwen3-8B-Base 上,270 步达到 0.495;在 Qwen3-4B-Base 的对比中作为基线可被 ISO 更快达到相近精度。在本文报告中,达到相同精度通常需要更多步数。ISO-Optimizer 在所报告设置下更省步数。
Muon在线优化器基线作为对照优化器,用于比较固定谱坐标下的更新效果。在 Qwen3-4B-Base 上,ISO-Muon 以 220 步达到最强 Muon 基线 300 步的最终准确率 0.422,最终到 0.428。ISO-Muon 在所报告设置下更快达到同等结果。
数据自由合并基线离线合并方法基线是 ISO-Merger 的直接比较对象,覆盖无训练合并场景。在 Qwen2.5-7B 和 DeepSeek-R1-Distill-Qwen-1.5B 的报告中,平均分低于 ISO-Merger。ISO-Merger 在所报告对比中更强。

还不能确定的地方

ISO 在所有模型规模和任务上都保持 near-isospectrality。

当前证据来自特定模型与报告配置,摘要和节选未覆盖全部场景。

检查附录中的更多模型、任务和训练轨迹,确认不同规模下的 δΣ、ρΣ 分布。

ISO-Merger 的优势对非同源 checkpoint 或强重叠专家同样成立。

文段明确限制在共享基座专家与 checkpoint-only 设定,其他情形未验证。

查看是否有跨基座、跨域或高重叠专家的额外实验。

ISO 的步数节省会稳定转化为端到端训练成本下降。

方法增加了 polar retraction 和可能的多 GPU 分摊开销,实际收益依赖系统实现与 rollout 长度。

对比同一硬件和 rollout 设置下的 wall-clock time、吞吐与最终质量。

0.495、0.509、63.80、44.38 等数值差异具有统计显著性。

提供的证据未给出置信区间、重复次数或显著性检验。

查阅原文表格、附录或实验日志中的重复实验与方差报告。

AdamW、Muon 之外的优化器在 ISO 框架下也会得到同样改善。

证据只覆盖少数优化器与具体学习率扫参。

阅读附录或补充实验,确认其他优化器和超参范围下的结果。

术语表

RLVR
基于奖励反馈进行的强化学习式后训练,常用于让模型更会推理或写代码。
奇异值谱
矩阵分解后中间那组表示“强弱大小”的数值,决定各方向的重要程度。
奇异帧(singular frames)
矩阵分解中左右两边的方向基,决定这些强弱分量朝向哪里。
near-isospectrality
“近似等谱”的意思,即训练前后奇异值谱几乎不变。
Isospectral Optimization(ISO)
本文提出的固定谱参数化与优化框架。
ISO-Optimizer
ISO 的在线版本,只优化奇异帧,并在每步后做 retraction。
ISO-Merger
ISO 的离线版本,在共享基座专家之间合并帧变化,同时保留基座谱。

参考来源

来源追踪

摘要: ISO 提出 spectral inheritance,并把方法分成 ISO-Merger 与 ISO-Optimizer。 arXiv metadata

摘要: Qwen3-8B-Base 上,AdamW 270 步达 0.495;ISO-AdamW 100 步达同样 0.495,210 步进一步达到 0.509。 arXiv metadata

摘要: ISO-Merger 在对比的数据自由合并方法中取得最强总体表现。 arXiv metadata

第 3 节: RLVR 检查点呈现 near-isospectrality,δΣ 与 ρΣ 显示谱漂移较小。 Paper section 3

第 4 节: ISO 用固定谱参数化 W(U,V)=UΣ0V⊤,只优化两个奇异框架 U、V。 Paper section 4

第 5 节: ISO-Merger 在 checkpoint-only、无 post-merge 数据与 rollouts 的条件下合并共享基座专家。 Paper section 5

第 6 节: Qwen2.5-7B 与 DeepSeek-R1-Distill-Qwen-1.5B 上,ISO-Merger 的平均结果高于最强无训练合并基线;retraction 开销约占 7%。 Paper section 6

第 7 节: Qwen3-4B-Base 上,ISO-Muon 220 步达到最强 Muon 基线 300 步的最终准确率 0.422;Qwen3-8B-Base 上 ISO-AdamW 210 步到 0.509。 Paper section 7

关于这篇论文的三个关键问题

ISO:把 RLVR 训练改写成“固定谱、优化奇异帧” 解决了什么问题?

RLVR 的目标是让模型在推理、代码等任务上更会“做题”。问题是,训练时奖励信号到底怎样变成权重变化,并不清楚。

ISO:把 RLVR 训练改写成“固定谱、优化奇异帧” 的核心结论有哪些证据?

本文提出了一个面向 RLVR(reinforcement learning with verifiable rewards)的优化栈 ISO,把优化问题改写为“固定权重谱、只更新奇异帧”的参数化方式。 method 段:提出 spectral inheritance;将其形式化为 Isospectral Optimization (ISO),包括离线 ISO-Merger 和在线 ISO-Optimizer。

阅读 ISO:把 RLVR 训练改写成“固定谱、优化奇异帧” 时最需要注意什么局限?

ISO-Merger 仅在共享基座专家、checkpoint-only 的设定下报告。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro