DevicesWorld 发布:首个大规模跨设备智能体协同基准测试
核心事件
2026 年 7 月 15 日,研究团队在 arXiv 上发布了论文《DevicesWorld: Benchmarking Cross-Device Agents in Heterogeneous Environments》(arXiv:2607.13465)。该研究正式推出 DevicesWorld,这是一个面向跨设备协同操作的大规模可执行基准测试(Benchmark),旨在系统性地评估基于大语言模型(LLM)的智能体在异构设备环境中的协作与任务完成能力。相关代码与数据已开源至 GitHub:https://github.com/AgenticOrgLab/DevicesWorld。
现有评估体系的局限
当前,LLM 智能体在单一数字环境(如移动应用、桌面系统或智能家居)中的操作能力已取得显著进展。然而,现实世界中的用户目标往往跨越多个设备:信息可能来源于手机,处理过程在桌面端完成,最终结果需同步至另一台设备。现有的基准测试大多聚焦于单一的 dominant execution environment(主导执行环境),缺乏对智能体跨设备获取、整合信息并端到端完成具有跨设备依赖关系任务的能力评估。
DevicesWorld 的技术架构与设计
DevicesWorld 构建了一个统一的跨设备交互与评估框架,其核心特性包括:
- 多类设备环境集成:将移动端(Mobile)、桌面端(Desktop)和物联网(IoT)三类设备环境整合至同一框架内。
- 大规模任务集:包含 6,140 个标准化任务。每个任务均定义了自然语言用户目标、参与设备及其初始状态、可执行动作、基于规则的验证器(rule-based verifiers)以及清理程序。
- 自动化质量管控:采用多阶段构建与质量控制流程,确保任务贴近真实用户需求,同时通过设备状态和生成文件实现结果的自动验证,保证实验的可复现性与诊断价值。
前沿智能体的实测表现
研究团队在固定的评估集上对五款前沿 LLM 智能体系统进行了评估,结果揭示了当前技术在该领域的巨大差距:
- 整体成功率极低:所有参评方法的跨设备任务成功率均处于低位,表现最好的智能体仅达到 12.5%。
- 部分满足条件的失败现象:在失败的运行轨迹中,约 28.7% 的案例满足了至少一项评分条件,但仍未能完成整个任务。这表明智能体在复杂约束下的联合条件满足能力存在明显短板。
- 典型失败模式:轨迹分析显示,智能体主要卡在信息获取或界面操控环节;容易混淆源设备与输出设备的角色;或在所有条件未联合满足前过早终止任务。
行业启示
DevicesWorld 的发布标志着智能体评估从"单机单环境"向"多端异构协同"迈进。对于 AI 开发者与研究者而言,该基准测试提供了可执行、可复现且具备强诊断能力的评估工具,有助于精准定位智能体在跨设备工作流中的脆弱环节。对于关注 Agent 落地场景的创业者与技术团队,该基准测试的结果也清晰指明了当前多设备协同智能体距离可靠商用仍存在显著的技术鸿沟。