框架胜过模型?[schema] Harness 如何以近乎完美成绩攻破 ARC-AGI-3
7 月 16 日,伯克利博士后 Haven Feng 的一条推文在 AI 社区引发了巨大震动。推文显示,一套名为 [schema] 的智能体框架(Harness),在不修改任何模型权重的情况下,在 ARC-AGI-3 Public 集上取得了近乎完美的成绩:与 Claude Opus 4.8、Fable 5 组合达到 98.98% 的 RHAE;即使换成 GPT-5.6 Sol,分数也高达 95.35%。
这一结果不仅打破了 ARC-AGI-3 自今年 3 月上线以来仅 0.51% 到 13.33% 的成绩记录,更向行业抛出了一个尖锐的问题:当模型能力接近瓶颈时,拉开差距的关键究竟是更大的参数,还是更聪明的用法?
什么是 ARC-AGI-3 与 [schema]?
要理解这一突破的分量,首先需了解测试基准的难度。ARC-AGI-3 是由 ARC Prize 和 Keras 创造者 François Chollet 推出的"不告诉你规则"的游戏基准。智能体面对 64×64 网格和 16 种颜色,没有任何物体清单或目标说明,必须通过交互去猜测规则、识别对象并通关。Chollet 曾判断该基准"大约还能撑一年"才会饱和。
而 [schema] 则是一套包裹在大模型外部的 Harness 框架,由 Impossible Research、加州大学伯克利分校与卡内基梅隆大学研究者合作开发。其名称借自康德的"图式"概念,意指连接抽象概念与具体感知的构造规则。在工程实现上,它不重新训练模型,而是强制模型采用一种类似物理学家的思维方式:将每一关的机制写成一段可以运行、回放和修改的程序。
核心机制:把世界模型写成可证伪的程序
[schema] 的核心创新在于它将模型对世界的"隐性理解"转化为"显性代码"。大多数系统中,模型的世界表示是一个不可见的向量,而 [schema] 将其编码为一段可编辑的代码,具备三大优势:
- 可解释性:代码是文本文件,可读、可比对差异。
- 可验证性:可以通过回溯历史记录,逐条检查预测是否准确。
- 可搜索性:程序本身就是一个模拟器,可以在内部进行低成本的路径规划,无需消耗真实环境的操作次数。
"物理学家式"的工作流
[schema] 让智能体执行一个不可跳过的闭环:观察 → 提出假说 → 设计实验 → 修正规则 → 规划执行。
- 状态落地与机制发现:智能体首先将原始像素转化为可追踪的变量(如"玩家"、"墙"),并找出操作下的状态转移规则。如果预测与观测矛盾,智能体既可以修改规则,也可以重新定义"状态是什么",直到模型自洽。
- 现实优先级高于模型:这是 [schema] 的硬规矩。一旦真实环境的状态转移与理论预测不符,当前计划立即中止,智能体必须带着"反例"回到推演阶段修复模型,才能继续规划。
- 主动实验:当存在多条候选规则时,智能体会主动寻找能区分这些假设的操作。由于 RHAE 评分对多余操作施加平方级惩罚,这种"用最少的真实交互解决最多不确定性"的策略极大地提升了效率。
成绩背后的争议与冷静视角
尽管 98.98% 的成绩令人瞩目,但业内并未一边倒地喝彩。ARC Prize 总裁 Greg Kamradt 在肯定其核心思路(将世界模型写成程序而非向量)的同时,指出了几处关键存疑点:
- 兜底规则的介入:团队使用了一条固定的"兜底规则",即当单局得分低于 80 分时,会切换模型重跑。Kamradt 认为,根据"哪局跑得好、哪局跑得差"来切换模型,等于把环境和人的信息注入了流程,这与 ARC-AGI-3 要求智能体在毫无先验情况下独立解决问题的精神存在冲突。
- 人类概念的注入:官方文档中出现了"玩家"、"墙"等词汇。如果这些概念是人类告诉模型的,那么成绩部分是来自人类的知识而非纯粹的机器推理。
- 缺乏独立复核:目前的高分均为团队自报告结果,尚未得到 ARC Prize 的独立验证。
此外,GPT-5.6 Sol 从公开集 13.33% 到 95.35% 的巨大提升,团队也承认并非对等的 Harness 对比,Sol max 的 13.33% 是官方极简外壳下的单变体成绩,两者口径不同,仅能作为背景参照。
效率与启示:RHAE 指标下的行动力
[schema] 的成功很大程度上归功于其对 RHAE(Relative Human Action Efficiency)指标的深度优化。RHAE 计算的是智能体与人类基线操作步数的比值平方。
- 数据对比:在 M0R0 第 4 关中,智能体仅用 42 次动作通关,而人类基准为 500 次;在 FT09 游戏中,Fable 5 模型通过一次探测发现机制后,后续关卡仅需 13 步。
- 惩罚机制:由于采用平方计算,多走冤枉路的代价极高。例如,智能体 B 虽完成所有关卡,但因步数是人类的 2.7 倍,最终得分不到 14%,而步数逼近人类的智能体 A 得分高达 97.7%。
[schema] 证明了,通过构建可迁移的"机制"而非死记硬背"动作序列",模型可以大幅减少真实环境的交互成本。
结语
[schema] 团队将此次突破称为"一个新的开始",而非终点。它指向了一个清晰的趋势:AI 的竞争焦点正在从单纯的模型规模比拼,转向推理框架与工作流的优化。
虽然公开集的成绩不代表半私有集的表现,且存在关于评测公平性的争议,但 [schema] 展示了一种将科学方法(假设-实验-证伪)嵌入 AI 智能体的可行路径。对于开发者而言,如何设计更好的 Harness,让模型像科学家一样思考,或许比单纯追求更大的模型更具现实意义。