当 GUI Agent 干完活,怎么确认它真的干完了?IRA 给了个新答案

GUI Agent 跑完一轮,截图看起来操作都对,但任务到底完没完成,常常拿不准。

问题出在评测方式上。现在的 GUI 评测主流做法是看截图——Agent 执行完后,把最终界面跟预期结果做对比。但光看表面,很多东西是看不到的:系统配置改没改、文件到底写没写进去、应用设置是不是真的生效了。这些藏在界面底下的状态,才决定任务做没做完。

最近 arXiv 上有篇新论文就在解决这个问题。Chenrui Shi 等 8 位作者提出了 IRA(Interactive Reward Agent),思路很直接:既然截图不够,那就让评测系统主动去查——系统状态、文件数据、应用配置,一个不落。

IRA 走的是两条腿。拿到一个任务指令后,它先「提议」——根据任务推导出完成条件。然后进入「验证」阶段,通过调用系统工具、应用工具和 GUI 工具,从执行后的环境里收集证据,综合判断任务是否完成。这套 propose-then-verify 机制,把评测从「看一眼截图」升级成了「动手核实」。

为了验证效果,论文还配套发布了 GUI-RewardBench,包含 321 条 GUI 任务轨迹,覆盖 Ubuntu 桌面 10 个应用类别。IRA 在 benchmark 上达到 86.9% 的准确率,大幅超过现有的评测基线。

论文还把 IRA 用到了 GUI Agent 的强化学习训练里,作为 reward signal——结果是 OSWorld 任务成功率达到了 34.0%。这个数字放在 GUI Agent 领域不算低。

IRA 不只是个打分工具,还能当教练。过去训练 GUI Agent,给 reward 主要靠规则模板或者人工标注,精度差、成本高。IRA 提供了一个可自动化、可交互的 reward 信号来源,验证的是真实环境状态而不是界面截图——这意味着模型学到的策略更贴近真实操作结果,不只是界面表现。

IRA 也有边界。它目前依赖 Ubuntu 桌面环境,GUI-RewardBench 只有 321 条轨迹,规模不算大。propose-then-verify 这种多工具调用的流程,本身的延迟和开销论文没有展开讨论。真实场景下,如果每一步验证都要调一堆工具,那评测本身可能比任务执行还贵。

GUI Agent 正在从「会操作」往「靠谱」的阶段走——可靠地验证结果是前提。IRA 给出了一个比截图更深的答案。

这篇论文的思路值得关注,数据集的轨迹和代码暂未放出。对同样被「看起来做完了,其实没做完」折腾的人来说,它的验证逻辑有参考价值。

论文链接:https://arxiv.org/abs/2607.25904