SERPO 把测试时强化学习从「对答案」改成「建标尺」
用过 o1 或 R1 的人应该都有这个体感:让它做数学题或者写代码,多「想」一会儿确实有用,正确率能往上跳一截。但一旦问的是开放问题——比如总结一篇论文、分析一个医疗案例、或者回答一个没有标准答案的研究问题——你很难判断它「多想了一会儿」到底有没有用。因为没地方对答案。
这个缺口不是小问题。现实世界里大多数有价值的任务恰恰是开放式的。而现有测试时强化学习(Test-Time RL)的底层逻辑,还是「答案投票」——生成多个候选,选出现频率最高的那个。这在数学和代码上成立,因为正确解只有一个。到了开放生成场景,每个输出都是合理但不同的,投票就没有意义了。
今天看到的这篇 SERPO(Self-Evolving Rubric Policy Optimization),就是在这个点上做文章。论文由 Jianze Wang 等 8 位作者完成,7 月 29 日挂上 arXiv,核心思路很直接:既然没法对答案,那就让模型在推理时自己造评分标准。
SERPO 建立了一个三路自进化闭环。模型生成一批输出,按「好–正常–差」(Good-Normal-Bad)分成三个档案,并且保证它们之间的差异尽量拉大。系统从这些档案里反推出能区分好坏的规则——也就是 rubrics——并且只保留那些真正有判别力的。策略层面,用这些 rubrics 的概率分数作为奖励信号,优化生成策略。策略更新后的新输出再回去刷新档案和评分标准,形成闭环。
模型先自己乱写一批答案,自己分出好坏,总结出好答案长什么样,然后按这个标准调整自己的写法,再写一批更好的,重复循环。整个过程发生在推理阶段,不需要外部奖励模型,也不需要人工标注。
结果方面,论文报告了两个域内基准和四个域外基准的表现。HealthBench 提升了 20.63 分,ResearchQA 提升了 20.31 分,六个基准的宏观平均提升了 8.06 分。更重要的是,它支持跨域迁移和持续的交叉基准进化——同一个闭环可以不断在更多任务上滚动迭代,不需要每次都从头训练。
当然,这篇论文没有回答所有问题。最明显的一个是计算开销:自进化闭环需要在推理时反复生成、分类、提炼规则,比单次推理贵多少,论文没有给出直接对比。另一个是 rubric 的质量——模型自己造的标准,会不会存在盲区或者自我强化偏见?G-N-B 三档分离和概率评分机制在缓解这个问题,但天花板在哪,还不清楚。
但方向是对的。测试时计算(test-time compute)是过去一年大模型最活跃的方向之一,但大部分工作集中在可验证任务上。SERPO 把这块拼图往开放领域推了一步——不需要标准答案,模型也能在推理时自我进化。
对做 Agent 和应用层的人来说,这可能比 benchmark 数字更有嚼头。很多 Agent 工作流卡在「模型能不能自己判断做得好不好」这个环节上,尤其在没有明确反馈信号的开放任务里。如果 SERPO 这类方法能落地,意味着 Agent 可以在运行时自己评估自己的输出质量,而不全靠外部 reward model 或者人工兜底。
论文有 20 页正文加附录,CC-BY 4.0 许可,PDF 和 HTML 版本都已公开。有兴趣可以直接翻。
相关链接
- 论文 PDF:https://arxiv.org/pdf/2607.26873
- HTML 版本(实验性):https://arxiv.org/html/2607.26873v1
- arXiv 页面:https://arxiv.org/abs/2607.26873