返回报告库

AI / Technology

谱继承:把RLVR更新拆成“保留基谱、只学框架”

这篇工作研究的是一种很具体的后训练问题:在强化学习式的可验证奖励训练(RLVR)里,模型权重到底是怎么被改写的,以及能不能把“该保留什么”和“该学习什么”分开。作者的主张是,RLVR里很多检查点都接近基模型的固定谱家族,也就是奇异值结构几乎不变,但左右“框架”会继续适应。

关于这篇论文的三个关键问题

谱继承:把RLVR更新拆成“保留基谱、只学框架” 解决了什么问题?

RLVR 的目标不是单纯拟合标签,而是让模型根据奖励信号学会更好的输出。这里真正麻烦的地方不在“有没有奖励”,而在“奖励反馈最后是怎样变成权重更新的”。如果只看普通欧氏坐标,很难分清模型是在复用原来的结构,还是在重新塑形整个权重。

谱继承:把RLVR更新拆成“保留基谱、只学框架” 的核心结论有哪些证据?

这篇论文研究的是 RLVR(基于奖励的视觉/推理强化学习)中,权重更新为什么会表现出近似保谱(near-isospectrality),以及能否把“保持基谱、只学习框架”做成一种原生优化与合并方法。 PDF text / Page 4:问题部分明确写到“RLVR 的优化层如何把奖励反馈转化为权重更新,尚不清楚”“需要区分 RLVR 中‘复用什么’与‘改变什么’”。

阅读 谱继承:把RLVR更新拆成“保留基谱、只学框架” 时最需要注意什么局限?

近 isospectrality 目前只是对所分析矩阵的描述性事实,不等于证明优化器存在内在的保谱偏好。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro