后训练改变置信度:SFT、RL与OPD如何重塑大模型的推理校准

后训练改变置信度:SFT、RL与OPD如何重塑大模型的推理校准

事件:2026年7月15日,Shuhao Li等人将论文《Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape Pre-, Intra-, and Post-CoT Calibration》(arXiv:2607.13753)提交至arXiv,提出了一种三阶段置信度校准框架,系统分析了监督微调(SFT)、强化学习(RL)和在线策略蒸馏(OPD)三种后训练方法对大模型推理过程中置信度的影响。


一、背景:被忽视的"置信度"维度

当前,大语言模型的后训练方法——包括监督微调(SFT)、强化学习(RL)和在线策略蒸馏(OPD)——在数学推理等任务上取得了显著进展。然而,这些方法的评价几乎完全依赖于最终答案的准确率。

这种单一维度的评估忽略了一个关键问题:后训练是否改变了模型对自身推理过程的置信度校准?

换句话说,当模型说"我有80%把握"时,它真的只有80%的正确率吗?后训练过程是让模型更诚实了,还是更盲目自信了?

该论文首次系统地研究了这一问题。


二、三阶段校准框架

作者提出了一种创新的三阶段置信度评估框架,分别对应推理链(Chain-of-Thought, CoT)生成过程中的三个关键节点:

阶段 评估内容 对应能力
推理前(Pre-CoT) 难度估计 模型在开始推理前对问题难度的判断
推理中(Intra-CoT) 早期终止 模型在推理过程中判断是否应该停止
推理后(Post-CoT) 答案聚合 模型对多条推理轨迹的最终置信度

这一框架使得研究者能够追踪置信度在整个推理过程中的演变。


三、核心发现:三种方法各有专长

通过对数学推理基准测试的受控比较,论文得出了以下关键结论:

1. OPD 提供最优的推理前置信度

在线策略蒸馏(OPD)训练的模型在难度估计方面表现最佳,能够为后续推理提供最有用的先验置信度信号。

2. SFT 提供最强的在线信号

监督微调(SFT)训练的模型在早期终止场景中表现最强,其在线置信度信号最适合用于推理中途的动态决策。

3. RL 产生最可靠的轨迹级信号

强化学习(RL)训练的模型在答案聚合环节产生了最可靠的轨迹级置信度信号,适合用于多路径推理结果的整合。


四、关键洞察:置信度的"位置依赖性"

论文最重要的理论贡献之一,是揭示了置信度可靠性具有位置依赖性

  • RL 的置信度:在经历一个"路径承诺"(path-commitment)阶段后才变得可靠
  • OPD 的置信度:在早期有用,但在后期可能变成反向校准(inversely calibrated),即高置信度反而对应低正确率

这一发现解释了为什么某些后训练方法在某些场景下表现优异,而在另一些场景下却适得其反。


五、PosConf:一种位置感知的置信度策略

基于上述发现,作者提出了 PosConf(Position-aware Confidence)策略:

仅在置信度可靠的相对位置区间内使用置信度信号。

实验结果

应用场景 改进幅度
RL 答案聚合(对比多数投票) +6.1 分
OPD 早期终止(严格 token 预算下) 最高 +4.3 分(避免反向校准区域)

六、对从业者的启示

1. 不要只关注最终准确率

后训练方法的影响不仅体现在最终答案上,还深刻影响了模型的自我评估能力。在构建推理系统时,应同时评估置信度校准质量。

2. 不同方法适合不同阶段

  • 如果你需要在推理前做问题筛选,OPD 可能是更好的选择
  • 如果你需要动态控制推理长度,SFT 的在线信号更可靠
  • 如果你需要进行多路径答案聚合,RL 的轨迹级置信度更可信

3. 置信度不是全局一致的

同一模型在不同推理阶段的置信度可靠性可能截然不同。简单的"阈值截断"策略可能不够,需要考虑位置感知的校准方法。


七、资源链接


本文所有事实、数据和引用均来源于 arXiv:2607.13753 原始论文材料,未添加任何外部信息。