旅行规划新基准上线:最强 Agent 只拿到 46 分,中位数不到 7

让 LLM 规划过旅行的人,大概率遇到过这种场景——酒店名字听着靠谱但根本搜不到,航班号格式完美但航司没这条线,行程看起来丰满但在地图上一跑发现全在绕路。Agent 的能力缺口一直没被硬碰硬地测过。

7 月 29 号 arXiv 上挂了一篇论文,「TREK」(Travel Reasoning and Evaluation Kit),来自港中文团队。他们做了一个专门测 LLM Agent 能不能搞定真实旅行规划的基准——不是问"北京有什么好玩",而是丢给你一堆硬约束:预算、天数、同行人偏好、城市间交通衔接,最后要交出一份真正可执行的行程单

打分器不靠感觉

以前测旅行规划,主流方法是人类打分或者 LLM 判卷。说酒店合理,它就在那栏得分。但酒店到底存不存在?航班时间能不能接上?预算超没超?没人较真。

TREK 的打分器是纯规则、确定性的,不用 LLM 判。你的行程要过五关:每条航线、每个酒店、每个景点都得在知识库里真实存在;每天路线在地理上走得通;预算不超;时间顺序合理;以及最难的一条——满足旅行者没说出来的偏好

这个知识库 212,530 条记录,覆盖 375 个城市,13 种旅行者画像。800 个任务里有 533 个理论上可解,267 个就是设计成无解的——专门看 Agent 会不会硬编一个方案出来糊弄人。

结果相当残酷

论文测了 15 个 LLM Agent,包括 GPT-5.6。在有解任务上,GPT-5.6 是表现最好的,完全可行率 46.2%。其余模型的中位数是 6.6%,底部直接挂零——0.0%,不止一个。

46% 意味着就算你现在能用到的最强模型,做一趟复杂行程,也只有不到一半概率给你一个不用返工的结果。剩下的一半多时间,要么酒店是编的,要么路线走不通,要么钱不够花。

论文指出所有 Agent 的通用瓶颈是同一个:满足旅行者未明说的需求。一个预算敏感的背包客和一家里有老人的家庭团,对住宿、交通、节奏的要求完全不同。任务描述里不会直说,但 Agent 应该能推断出来。目前没有一个模型能稳定做到。

几个设计细节

TREK 专门做了 267 个不可能任务,用来测 Agent 懂不懂什么时候该说"办不到",而不是硬编方案。这个设计补了现有基准的缺口——很多基准只看能力上限,不看 Agent 有没有基本的自知之明。数据集、工具沙箱、评估器、Agent 代码全部开源,GitHub 链接在论文页面上,结果可完全复现。每条有解任务都附带人工验证的金标答案,在确定性评估器上得满分 1.0——天花板真实存在,评分器并不苛刻。

这个工作更像一面镜子,映出的是一个现实:旅行规划看起来门槛不高,实际对多步推理、工具调用、约束满足、常识推断的要求都很高。一个行程单要同时满足七八条相互制衡的条件,还得像真人会那么走——这比写一首诗或者答一道数学题难多了。

站在开发者角度看,46% 这个数字给出了一个清晰信号:如果要做旅行方向的 AI 产品,别指望靠模型能力兜底。前端的约束检查、后端的知识库对齐、人机协同的编辑流程,一个都不能省。

论文里那句 "even the strongest produces a fully-feasible plan on only 46.2%" 应该会被反复引用。中位数 6.6% 说明大部分模型在面对真实硬约束时,还是"听起来合理就行"的老思路。评测一升级,底裤就藏不住了。

相关链接

  • 论文 PDF:https://arxiv.org/pdf/2607.26977
  • GitHub 仓库:https://github.com/TonyQJH/TREK-A-Travel-Reasoning-and-Evaluation-Kit-for-LLM-Agents-in-Complex-Trip-Planning