Ring-Zero:将零样本强化学习扩展至万亿参数,涌现推理能力

Ring-Zero:将零样本强化学习扩展至万亿参数,激发涌现推理能力

2026年7月14日,一篇题为《Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning》的研究论文提交至 arXiv。该研究首次将无人类标注数据的零样本强化学习(Zero RL)扩展至 1 万亿参数规模,系统性地探索了大规模模型在推理能力上的训练动态与涌现行为。

研究背景

零样本强化学习(Zero RL)是一种无需人工标注数据、通过可验证奖励进行训练的范式,已被证明能够有效激发模型的思维链(Chain-of-Thought)推理能力。然而,受限于计算资源,现有研究大多局限于小模型,大规模场景下的训练动态和涌现能力仍属未知领域。

研究团队指出,简单粗暴地扩展模型规模往往会导致可读性差、token 冗余以及缺乏自适应推理深度等问题。为解决这些挑战,团队提出了一套稳定且高效的训练流水线,融合了多项算法与系统级优化技术。

关键技术突破

论文提出了三项核心优化手段:

  1. 裁剪重要性采样(Clipped Importance Sampling):用于稳定训练过程中的策略更新。
  2. 训练-推理比率校正(Training-Inference Ratio Correction):平衡训练与推理阶段的计算分配。
  3. 混合精度控制(Mixed-Precision Control):优化显存使用效率,支持更大规模的模型训练。

三大关键发现

通过对 Ring-2.5-1T-Zero 模型的实验,研究团队验证了"Scaling Law(缩放定律)"的核心观点,并得出以下三个关键发现:

发现一:万亿参数显著提升效率与上限

扩展至 1 万亿参数显著提升了样本效率和性能上限,印证了大规模模型在推理任务上的优势。

发现二:训练过程呈现阶段性特征

训练过程依次经历两个阶段:
- 初始发现阶段(Discovery Phase):模型开始探索推理路径。
- 锐化阶段(Sharpening Phase):推理质量逐步精炼和提升。

发现三:高级认知行为的自发涌现

模型在无外部引导的情况下,自发发展出以下高级认知行为:
- 拟人化(Anthropomorphism)
- 结构化格式输出(Structured Formatting)
- 自我验证(Self-Verification)
- 并行推理(Parallel Reasoning)
- 上下文焦虑(Context Anxiety)

这些涌现行为使得传统手工设计的启发式规则变得多余。

评估框架与创新

数学基准测试

Ring-2.5-1T-Zero 在 七个数学基准测试 中取得了具有竞争力的表现。

思维链质量评估新框架

除了传统的最终答案正确率之外,研究团队提出了一种结构化评估框架,从三个维度评估思维链(CoT)质量:

评估维度 说明
可理解性(Comprehensibility) 推理过程是否清晰可读
可复现性(Reproducibility) 推理步骤是否可以被追踪和验证
效率(Efficiency) 推理过程的简洁程度

在该评估框架下,Ring-2.5-1T-Zero 在生成结构化且简洁的推理轨迹方面展现出明显优势。

研究意义

这项工作在两个层面具有重要意义:

技术层面:证明了零样本强化学习可以成功扩展至万亿参数规模,为后续更大规模推理模型的训练提供了可复用的技术路径。

认知科学层面:通过分享在 1 万亿参数尺度上观察到的多种涌现现象,为学术界和工业界理解大规模模型的缩放行为提供了新的洞察。

文献信息

  • 标题:Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
  • arXiv ID:2607.12395
  • 提交日期:2026 年 7 月 14 日
  • 学科分类:Computation and Language (cs.CL)
  • 作者:Xinyu Tang、Gangqiang Cao、Yurou Liu、Yuliang Zhan、Xiaochong Lan、Yifan Li、Yuchen Yan、Han Peng、Zican Dong、Zhenduo Zhang、Tianshu Wang、Xinyu Kong、Zujie Wen、Wayne Xin Zhao、Zhiqiang Zhang、Jun Zhou(共 16 位作者)
  • 原文链接:https://arxiv.org/abs/2607.12395
  • PDF 链接:https://arxiv.org/pdf/2607.12395
  • HTML 链接:https://arxiv.org/html/2607.12395v1
  • DOI:https://doi.org/10.48550/arXiv.2607.12395