给本地 Agent 加推理时长,效果越来越差?一篇论文把四种 Scaling 都测了一遍

最近「推理时缩放」(inference-time scaling)在 Agent 圈里很火,逻辑听着也顺:模型推理时多算一会儿,多思考几步,结果应该更好。OpenAI 的 o 系列、DeepSeek 的 R1 都在证明这条路走得通。

但这个逻辑放到本地部署的电脑操作 Agent(Computer-Use Agent, CUA)身上,情况完全不一样。

一篇 7 月底挂在 arXiv 上的论文,把这件事拆开了仔细测了一遍。作者来自韩国,实验做得挺实在:用 Qwen3-VL-8B/30B-A3B、UI-TARS-1.5-7B 和 OpenCUA-7B 这几个能在本地跑得动的模型,在 OSWorld 基准上测试了四种不同的 Scaling 策略——上下文缩放(Contextual)、时间步缩放(Temporal)、结构分解(Structural)和并行缩放(Parallel)。结论一句话:算力堆上去,收益快速递减,而且失败模式也跟着变。

这跟直觉里「多想想就能更聪明」不太一样。

上下文给多了,模型开始「假成功」

上下文缩放是最符合直觉的方向——让 Agent 在推理时看到更多历史轨迹信息,帮助它理解当前状态和之前做了什么。

加历史上下文确实能稳定轨迹、减少重复和卡住的情况,任务准确率也在提升。但收益很快饱和,Token 成本继续涨,效果不动了。

失败模式也在迁移。之前模型犯错主要是重复操作或卡在某个步骤出不来,加了大量上下文后,这类错误减少了,但模型开始出现「过早虚假成功」——任务根本没完成,模型却认为自己搞定了然后提前结束。从一个坑掉进另一个坑。

时间步拉长了,坏轨迹也跟着拉长

时间步缩放是给 Agent 更多的执行步数上限,理论上给它更多试错空间。

实际结果:最大步数卡住的情况确实减少了,但任务成功率没有明显提升。模型在没有正确决策的情况下拿到更多步数,并不会突然开窍,只是把错误的轨迹执行得更长。路径更长、Token 消耗更大,终点没变。

结构化分解:小模型扛不住的额外开销

把复杂任务分成规划和执行两个阶段,在大型模型上效果不错。但到了本地小模型这里,拆分反而增加了规划和格式化的开销。对于 7B-8B 级别的模型,多一层结构意味着多一层出错的可能,推理时间变长但质量没有对应提升。

并行缩放能部分缓解这些问题,但代价是计算量的大幅增加,对本地部署来说这笔账未必划算。

对做本地 Agent 的人意味着什么

这篇论文给出的提醒很务实:给本地模型加算力,不加筛选地加,换来的收益是边际递减的。

论文最后提的三个方向我觉得是实在话:需要选择性的算力分配(selective compute allocation)、能感知失败模式的控制机制(failure-aware control)、以及围绕本地模型能力和限制来设计的 Agent 框架,而不是把为大模型设计的方案硬塞给小模型。

对于正在把 Agent 塞进本地设备、塞进个人电脑的团队来说,跑通一个 Demo 不难,但要让本地模型稳定地操控电脑完成任务,真正的工程挑战不在堆算力,而在知道算力该往哪堆。