VLM 判官集体放水,OSReward 给 Agent 评估上了第一把硬尺

搞 Computer-using Agent 的人应该都熟悉这个流程:写完一个任务,跑一遍,把轨迹——截图加操作日志——丢给 VLM 看一眼,问它「干完了没」。它说干了,你就信了,进入下一个迭代。

这个做法已经是事实标准了。但有个问题一直没人认真较真:VLM 判官,到底靠不靠得住?

最近 arXiv 上的一篇工作 OSReward(arXiv:2607.28609)把这事系统性地翻了一遍。结论有点尴尬:目前最好的 VLM 做裁判,普遍有系统性偏袒——任务明明失败了,它们倾向于判成「过了」。而且跑得准的模型调用一次贵得离谱,便宜的开源模型准确度又差一大截。

OSReward 的核心动作很朴素。他们搭了一套标准考场,把不同 Agent 骨架在不同平台上执行过的任务轨迹收集起来,经过多轮人工标注,给每一条都打上了 Ground Truth 标签——这条轨迹到底算成功还是失败。然后拿这些「标准答案」去拷问现在主流的 VLM 判官,包括 GPT-4o 级别的闭源模型。

结果不太好。即使是 SOTA 级别的 VLM,离「理想判官」还有明显差距。而且错误不是随机分布的,是一个系统性的 leniency bias——判官在放水。这在做 Agent 落地的人眼里是很要命的事。评估数据、RL reward signal,都建立在「VLM 说了算」的基础上。如果判官本身就不可靠,那整个反馈循环都在积累噪声。

论文说得也很直白:不管是手写 verifier 还是人工标注,都没法规模化,行业只能依赖 VLM judge,但从来没人认真验证过这些 judge 行不行。OSReward 等于把这块一直没人掀的桌布给掀了。

掀完桌布他们也没走,顺手做了几件实在事。

他们把困难样本单独拎了出来,做了 OSReward-Hard——专挑那些模棱两可的硬骨头去考判官——和 OSReward-Multi,用来做更细粒度的效率和对齐评分。这相当于给行业提供了一套可以反复使用的标准化试卷。

他们还放出了 OS-Shepherd-100K,一个 10 万条带推理过程的轨迹判卷数据集。在上面训了 OS-Shepherd 9B 和 35B 两个开源 reward model。效果上,OS-Shepherd 的判断能力能追上 GPT-4o 级别的闭源模型,但推理成本低了 30% 到 60%。对于每天要判几万条轨迹的生产环境,这个差距是实打实的预算差异。

不过论文也没吹自己一步到位。OS-Shepherd 和「理想判官」之间还有距离,而且「理想判官」本身也是个 moving target——Agent 越来越复杂,任务的判断标准也在变。

但 OSReward 让这个领域往前走了一步。以前大家靠 VLM 判卷,基本凭着一种「大概可能还行」的默契在干活。现在至少有了一个能对照的考场、一套标准化试题、和一个便宜得多的开源判官。

代码、数据和模型权重都在这里:https://os-copilot.github.io/OSReward-Home/

至少下次你的 VLM 判官说「过了」的时候,你会知道它可能只是又放了一次水。而且你手里多了一个选项:花更少的钱,找一个没那么爱放水的判官。