SVR 论文速读:模型学会自验自停,推理不用算死账

部署模型做数学推理时有一个两难:同一个模型,有的题一步就解对,有的题绕了十轮还在改答案。固定预算浪费算力,挂外部 verifier 又增加部署复杂度。

arXiv 上这篇 SVR(Self-Verifying Refinement)论文给出的方案是让模型自己学会判定答案是否正确以及把握大小,然后根据这两个信号决定是否继续推理。

每轮推理时,模型同时输出答案、一个「正确/错误」判定和一个置信度分数。只有判定为正确且置信度超过阈值时,才保留答案并停止;否则继续下一轮 refinement。整个过程不需要外部 verifier 或 ground-truth 标签介入——这些信息只在训练阶段用来构造 reward。

训练用 GRPO 在固定长度的 trajectory 上做强化学习,reward 同时惩罚答案错误、惩罚自验证不准、奖励在正确状态及时停止。推理时自适应停止是激活的,但 ground-truth 完全不暴露给 policy。

实验用 Qwen3.5-2B 在 7 个数学推理 benchmark 上跑,macro-average 准确率 0.563,平均推理轮数只有 2.99。对比标准 GRPO、多轮 baseline 和固定 10 轮 oracle 指导的 score-feedback 方案,SVR 在更少轮数下超过了这些参考线。

这个结果有意思的地方:2B 模型 0.563 的绝对精度谈不上惊艳,但它验证了一个更实用的方向——自验证能力可以通过训练内化为模型自身的推理控制信号,不需要外部裁判。这意味着可以直接在模型输出中拿到一个「确定程度」信号来做 early exit,省掉 verifier 的开销和延迟。

限制也很明显。目前只在数学推理场景验证过,数学问题天然有明确的对错标准,自验证在开放域任务上的可靠性还不清楚。论文也依赖 confidence threshold 来调节停止条件,模型过度自信的问题没有彻底解决。代码和模型权重暂时没有公开。

论文链接:https://arxiv.org/abs/2607.28457