Ring-Zero:将零样本强化学习扩展至万亿参数,涌现推理能力
Ring-Zero:将零样本强化学习扩展至万亿参数,激发涌现推理能力
2026年7月14日,一篇题为《Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning》的研究论文提交至 arXiv。该研究首次将无人类标注数据的零样本强化学习(Zero RL)扩展至 1 万亿参数规模,系统性地探索了大规模模型在推理能力上的训练动态与涌现行为。
研究背景
零样本强化学习(Zero RL)是一种无需人工标注数据、通过可验证奖励进行训练的范式,已被证明能够有效激发模型的思维链(Chain-of-Thought)推理能力。然而,受限于计算资源,现有研究大多局限于小模型,大规模场景下的训练动态和涌现能力仍属未知领域。
研究团队指出,简单粗暴地扩展模型规模往往会导致可读性差、token 冗余以及缺乏自适应推理深度等问题。为解决这些挑战,团队提出了一套稳定且高效的训练流水线,融合了多项算法与系统级优化技术。
关键技术突破
论文提出了三项核心优化手段:
- 裁剪重要性采样(Clipped Importance Sampling):用于稳定训练过程中的策略更新。
- 训练-推理比率校正(Training-Inference Ratio Correction):平衡训练与推理阶段的计算分配。
- 混合精度控制(Mixed-Precision Control):优化显存使用效率,支持更大规模的模型训练。
三大关键发现
通过对 Ring-2.5-1T-Zero 模型的实验,研究团队验证了"Scaling Law(缩放定律)"的核心观点,并得出以下三个关键发现:
发现一:万亿参数显著提升效率与上限
扩展至 1 万亿参数显著提升了样本效率和性能上限,印证了大规模模型在推理任务上的优势。
发现二:训练过程呈现阶段性特征
训练过程依次经历两个阶段:
- 初始发现阶段(Discovery Phase):模型开始探索推理路径。
- 锐化阶段(Sharpening Phase):推理质量逐步精炼和提升。
发现三:高级认知行为的自发涌现
模型在无外部引导的情况下,自发发展出以下高级认知行为:
- 拟人化(Anthropomorphism)
- 结构化格式输出(Structured Formatting)
- 自我验证(Self-Verification)
- 并行推理(Parallel Reasoning)
- 上下文焦虑(Context Anxiety)
这些涌现行为使得传统手工设计的启发式规则变得多余。
评估框架与创新
数学基准测试
Ring-2.5-1T-Zero 在 七个数学基准测试 中取得了具有竞争力的表现。
思维链质量评估新框架
除了传统的最终答案正确率之外,研究团队提出了一种结构化评估框架,从三个维度评估思维链(CoT)质量:
| 评估维度 | 说明 |
|---|---|
| 可理解性(Comprehensibility) | 推理过程是否清晰可读 |
| 可复现性(Reproducibility) | 推理步骤是否可以被追踪和验证 |
| 效率(Efficiency) | 推理过程的简洁程度 |
在该评估框架下,Ring-2.5-1T-Zero 在生成结构化且简洁的推理轨迹方面展现出明显优势。
研究意义
这项工作在两个层面具有重要意义:
技术层面:证明了零样本强化学习可以成功扩展至万亿参数规模,为后续更大规模推理模型的训练提供了可复用的技术路径。
认知科学层面:通过分享在 1 万亿参数尺度上观察到的多种涌现现象,为学术界和工业界理解大规模模型的缩放行为提供了新的洞察。
文献信息
- 标题:Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
- arXiv ID:2607.12395
- 提交日期:2026 年 7 月 14 日
- 学科分类:Computation and Language (cs.CL)
- 作者:Xinyu Tang、Gangqiang Cao、Yurou Liu、Yuliang Zhan、Xiaochong Lan、Yifan Li、Yuchen Yan、Han Peng、Zican Dong、Zhenduo Zhang、Tianshu Wang、Xinyu Kong、Zujie Wen、Wayne Xin Zhao、Zhiqiang Zhang、Jun Zhou(共 16 位作者)
- 原文链接:https://arxiv.org/abs/2607.12395
- PDF 链接:https://arxiv.org/pdf/2607.12395
- HTML 链接:https://arxiv.org/html/2607.12395v1
- DOI:https://doi.org/10.48550/arXiv.2607.12395