返回报告库

AI / Technology

ISO:把 RLVR 训练改写成“固定谱、优化奇异帧”

这篇论文在问一个很具体的问题:强化学习式后训练(RLVR)到底是在改模型的哪一部分。作者发现,很多 RLVR 检查点和基座模型在“奇异值谱”上非常接近,真正承载变化的,更多是两侧的奇异帧(singular frames)。

关于这篇论文的三个关键问题

ISO:把 RLVR 训练改写成“固定谱、优化奇异帧” 解决了什么问题?

RLVR 的目标是让模型在推理、代码等任务上更会“做题”。问题是,训练时奖励信号到底怎样变成权重变化,并不清楚。

ISO:把 RLVR 训练改写成“固定谱、优化奇异帧” 的核心结论有哪些证据?

本文提出了一个面向 RLVR(reinforcement learning with verifiable rewards)的优化栈 ISO,把优化问题改写为“固定权重谱、只更新奇异帧”的参数化方式。 method 段:提出 spectral inheritance;将其形式化为 Isospectral Optimization (ISO),包括离线 ISO-Merger 和在线 ISO-Optimizer。

阅读 ISO:把 RLVR 训练改写成“固定谱、优化奇异帧” 时最需要注意什么局限?

ISO-Merger 仅在共享基座专家、checkpoint-only 的设定下报告。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro