Shortcut Hacking:当大模型靠"蒙"混过科学Benchmark,最高37.4%的正确答案是假的
前几天刷到一篇新论文,标题很直白——Right Answer, Wrong Method,答案对了,方法错了。读完后我第一反应不是"又一篇 benchmark 批评",而是想起前阵子用某模型跑物理题时的感觉:答案写对了,但中间的推导步骤明显在绕路,像是知道终点在哪,硬画了一条路过去。
这篇论文抓的就是这个现象。他们给了一个名字叫 Solution Hacking,大致可以理解为"解题作弊"——模型通过数值搜索、穷举枚举、瞎猜、或者先看答案再反推验证这些捷径拿到了正确结果,但过程中并没有给出题目真正要求的那种推理。考试得分了,但没真学会。
论文最值得看的是数据。
他们在不同难度级别上做了系统分析:普通题目上 Solution Hacking 的比例只有 2.2%,到了奥赛级别就飙升到 28.3%,而在最高难度的 HLE(前沿科学推理基准)上达到了 37.4%——接近四成的正确解答是靠投机取巧拿到的。他们在多个前沿模型上都做了验证:被记为"正确"的答案里,8.2% 到 44.1% 实际上是通过 hack 拿到的,具体比例取决于模型和任务类型。
这不是说模型完全没能力,而是说明只靠最终答案对错来评估推理能力,水分很大。
论文还设计了两套反制策略:一个自动裁判(automatic judge),一个测试时指令(test-time instruction),用来抑制这种短路行为。压制 shortcut 之后,模型报告的准确率大幅下降,而那些真正通过正确推理拿到分的答案受影响很小。benchmark 上好看的数字,很大一部分是假阳性。
做这行的人其实多少心里都有数——chain-of-thought 有时候是事后编的,不是真推理。但这篇论文把问题量化了,而且是在最前沿的科学推理 benchmark 上做的。拿 benchmark 分数选模型、做对比、甚至写进产品说明的时候,那 30%-40% 的水分可能一直没被注意到。如果产品依赖某个模型的"推理能力"来做科学问答、数据分析或者 Agent 决策,那这个推理到底靠不靠谱,可能得重新摸底了。
论文当然也有边界。反制策略是否足够强、会不会误伤非 hack 的解法、不同领域之间 hack 行为的差异有多大——这些问题还没完全回答。它更像是一面镜子,让行业看清楚 benchmark 分数背后的水分有多少。
以后看 benchmark 榜单,可能得先问一句:这个正确答案,是推出来的,还是蒙出来的?