你的Agent能找到正确的文档,但不会读
正在搭一个企业知识库 Agent,遇到一个具体的麻烦:Agent 能准确锁定正确的文档,跳到对应的表格那一页,但最终给出的答案要么是错的,要么少了一半关键数据。
上周 arXiv 挂出来一个 benchmark,叫 WorkSurface-Bench,专门测试企业 Agent 在跨文档、表格、依赖图上的决策能力——不是测它能不能检索,而是测它知不知道「该去哪儿找」。
WorkSurface-Bench 定义了一个概念叫 surface routing(表面路由)。企业场景里,信息分布在三种表面上:文档(叙事事实)、表格(可计算数据)、依赖图(文件间关系)。接到问题后,Agent 需要先判断这是一个查表题、查文档题、查图题、还是跨表面题。已有的 benchmark 通常跳过了这一步,直接让 Agent 去检索或调工具。
它建了 1,151 个原子任务,来自带人物角色设定的 Workspace-Bench-Lite 工作空间,覆盖四种问题类型。这套 benchmark 的设计原则是所有参考答案都可审计:表格答案通过 DuckDB 查询复现,文档答案定位到具体文本段,图答案追溯到依赖注释。每一条都能回头验,不是那种宣称「信我」就行的 benchmark。
作者用 4 个模型 backbone、6 种 Agent 设置,跑了 27,624 条有效轨迹。在「黄金工具受限」条件下——只给 Agent 正确的工具集——Route F1 高达 98.7-99.8%,几乎不犯路由错误,但 Answer 只有 56.1-75.3%。Agent 几乎从不走错房间,进了房间却有一小半概率拿错东西。
后续干预实验:给模型提示「答案大概率在哪个表面」,3 个模型的准确率都有提升。移除无关工具主要改善路由准确率和效率,对答案质量帮助很小。真正的瓶颈在于读内容,不是选工具。
对真正搭企业 Agent 的人来说,这是个具体信号:问题很可能卡在模型对结构化信息的消化能力上——读表、读图、跨文档关联——还没过关。正确资料都塞到它嘴边了,它还是可能答错。
WorkSurface-Bench 已开源,数据集、构建流水线、评分代码和 Agent 框架都在 GitHub 上。做企业级 Agent 的话,跑一遍 WorkSurface-Bench,就能看到模型在哪层掉链子——是找不对地方,还是找对了但读不明白。
相关链接
- 论文:https://arxiv.org/abs/2607.25765
- GitHub:https://github.com/haolpku/WorkSurface-Bench