Agent 拿到地图还在暴力搜索,ScrambleToolBench 把这个问题摆上了台面
上周末 arXiv 冒出来一篇论文,标题本身就挺有意思——「ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step」。大意是,Agent 手里有一张清清楚楚的地图,上面标着下一步该往哪走,但它还是选择把整栋楼翻一遍。
这篇东西来自 Vernon Toh、Navonil Majumder、Zhengyuan Liu、Nancy F. Chen 和 Soujanya Poria,8 月 3 号挂出来的。不是新模型,也不是新框架——这是一个专门用来拆穿 Agent 工具调用能力幻觉的 benchmark,而且拆得挺狠。
先说 ScrambleToolBench 干了什么。
现有的工具调用 benchmark,基本上都是给 Agent 暴露带语义的 tool schema——函数名、参数名都是英文单词,模型一看就知道这个工具是干什么的。这等于开卷考试:模型靠预训练阶段见过的知识就能猜个七七八八,根本不需要真正地「摸索」一个工具的用法。
ScrambleToolBench 把这条路堵死了。它把工具名、参数名全部打乱成无意义字符串,塞进一个交互式终端环境。Agent 没有文档,没有语义线索,只能靠试错——发一次命令,看返回,再发一次——来摸清楚每个工具到底干什么。像一个刚入职的人被丢到一个全是缩写和内部代号的系统里,没人给 Wiki。
再往下看是动态挑战:mapping drift(映射漂移)——工具的行为在运行过程中发生变化,之前摸索出来的规律突然不奏效了;stochastic action failures(随机动作失败)——命令发出去不一定执行成功;temporal execution windows(时间执行窗口)——有些工具只在特定时间窗口内可用。
这基本就是生产环境里真实遇到的问题:工具半夜挂了、API 超时了、权限悄悄改了。Agent 能不能感知到并调整策略?
论文的结论让人有点不舒服。
他们测了当前 state-of-the-art 的语言模型,发现一个规律:Agent 能在初始阶段通过暴力搜索摸索出工具用法,但环境变了之后,它依然沿用暴力搜索,而且越搜越起劲。论文原文说得很直白:增加 test-time reasoning,只会放大这种昂贵的穷举搜索,不会导向真正的推理恢复。给模型更多思考时间,它思考出来的结果是「再试一遍,再试一遍,再试一遍」。
这个现象论文里给了个名字叫「belief inertia」——信念惯性。Agent 形成一套对环境的解释之后,即便证据已经变了,也倾向于不放弃原有假设,更不会主动去追溯因果链条(cycle tracing)。它宁愿把整个 action space 重新扫一遍,也不愿意停下来想「刚才那个返回值和预期不一样,是不是我的模型错了?」
我自己的感受是,这跟我在实际项目里观察到的 Agent 行为高度一致。很多 Agent 在 demo 里跑得漂亮,是因为环境是静态的、工具是文档化的、失败路径是预设好的。扔到长期运行的 production 场景里——API 版本升级、参数废弃、返回格式变化——Agent 的第一反应不是推理,而是重试。重试不行就换参数组合试。试不出来就崩。
论文还试了给 Agent 加 persistent memory(持久化记忆)。效果是有的——减少了累积错误——但依然无法高效推断结构性变化。记忆帮它记住了「刚才那个工具返回了什么」,但没有帮它理解「为什么返回变了」和「下一步应该怎么调整推理路径」。
这指向一个更深层的问题:当前的 Agent 架构里,记忆和推理是分离的。记忆层存日志,推理层照旧做 next-token prediction,两者之间没有形成一个「观察 → 假设 → 验证 → 更新模型」的闭环。ScrambleToolBench 把这个缺口用 benchmark 的形式固定下来了,这是一个有价值的贡献。
也要说清楚边界。ScrambleToolBench 是一个 terminal-based benchmark,场景偏向低层级命令行工具探索。它不代表所有 Agent 场景,但它抓住了一个在 GUI Agent、API Agent、浏览器 Agent 里同样存在的核心矛盾——当语义线索被剥离、环境开始漂移,Agent 是智能体还是暴力搜索器?
目前论文只有 abstract 和 PDF,代码和数据还没看到公开链接。如果后续开源了,这个 benchmark 会是 Agent 评估里一个很有意思的补充——不替代现有 benchmark,而是在「语义线索剥干净」这个极端条件下压出模型的真实适应能力。
这篇论文没有给出解决方案。它只是提醒一件事:「你们以为 Agent 会推理,其实它在暴力搜索」。这个判断不一定全对,但足够让人不舒服。
相关链接