Nanbeige4.2-3B 发布|3B 参数在 Agent 任务上反超 9B 模型,小模型路线给了一个新答案
南壁实验室这两天放出来了一个有意思的模型——Nanbeige4.2-3B。3B 非嵌入参数,从零开始用 28T tokens 预训练,在 Agent 相关基准上跑过了 Qwen3.5-9B 和 Gemma4-12B。一个 3B 的模型去跟 9B、12B 的模型比 Agent 能力,居然赢了。
架构上,Nanbeige4.2-3B 用了 Looped Transformer——同一组层重复使用,相当于把有限的路来回走几趟,不增加参数但把有效深度拉上去。这个思路不新,但落地到 3B 尺寸的 Agent 模型是第一次见。参数总量不变,推理时可以"多想几轮",这对 Agent 场景里的多步推理和工具调用来说挺关键。
比架构更重要的是训练流程。论文里列了三层 RL 递进:
混合模式 RLHF,同时对 Think(深思熟虑型回答)和 Non-Think(快速直觉型回答)做对齐,让模型自己判断什么场景该快、什么场景该慢。长度控制推理 RL,在提升推理质量的同时限制输出长度,避免模型为了刷分而疯狂写长答案——Agent 场景的响应速度直接影响体验。Agentic RL,用结果奖励加过程奖励来稳定长程训练。Agent 任务链条长,中间一步错后面全崩,过程奖励相当于每一步都给了反馈信号,而不是到最后才知道死没死。
三层叠下来,目标很明确:让一个小模型在 Agent 任务上既能推理、又能干活、还不会废话连篇。
论文给出的对比是:在各类 Agent 基准上超过 Qwen3.5-9B 和 Gemma4-12B,同时在数学、编程、科学等推理任务上保持竞争力。没有提具体跑分数字,但 3B 和 9B、12B 的对比结果本身就指向一个判断——Agent 能力可能不只是"参数越多越强",训练数据的多样性和 RL 流程的设计权重很大。
论文提到 SFT 阶段做了两件事:用真实部署扩大可执行环境的多样性,靠大规模合成方法扩增任务资产和 Agent 脚手架。这两个做法对应的现实问题是——Agent 模型的训练数据不像纯文本那样好搞,需要真实的执行反馈和丰富的工具调用场景,否则模型学到的只是"表演 Agent"而不是真干活。
论文还提到配合 OpenClaw 使用,可以作为紧凑的本地个人助手。OpenClaw 应该是一个 Agent 框架或运行时,模型在本地跑、本地执行工具调用,这对隐私和延迟敏感的场景有意义。目前关于 OpenClaw 的具体信息还不多,等后续再看。
3B 模型再强也有边界。复杂的长程任务、需要大量上下文记忆的场景、需要广泛世界知识的开放式问题,小模型的容量天花板是物理存在的。它在 Agent 场景上赢了更大的模型,更多说明的是在合适的训练方法下,小模型能把 Agent 能力发挥到相当高的水平——这不等于小模型全面取代大模型。
这篇论文给了一个信号:模型竞争不只是在拼参数大小,训练流程的设计——尤其是面向 Agent 的 RL 流程——正在成为一个关键的差异化因素。下一阶段既要看模型大小,也要看谁会训练模型干活。
相关链接
- 论文地址:https://arxiv.org/abs/2607.22083
- PDF:https://arxiv.org/pdf/2607.22083