OmniaBench:面向通用 AI Agent 的多场景基准测试揭示前沿模型局限

OmniaBench: 通用 AI Agent 综合基准测试框架

引言

2026 年 7 月 16 日,Chengyu Shen 等 16 位研究人员在 arXiv 上发布了 OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios(arXiv:2607.14989)。该论文提出了一套面向通用 AI Agent 的综合基准测试框架,旨在系统性地评估大语言模型从"文本生成器"向"通用智能体"演进过程中的真实能力边界。

研究背景与核心问题

随着大语言模型逐渐具备理解用户请求、调用外部工具和通过交互完成复杂任务的能力,AI Agent 的评估需求日益迫切。然而,现有基准测试往往局限于特定场景、工具生态或交互格式,难以刻画模型在不同异构应用环境下的综合能力。

OmniaBench 的提出正是为了解决这一痛点,提供一个广泛且具诊断性的评估框架。

架构设计

场景知识体系

研究团队从应用商店、产品文档、行业资源、网络检索以及人工完善等多个来源提取面向应用的场景知识,构建了分层分类体系:

  • 覆盖范围:ToC(面向消费者)、ToB(面向企业)、ToE(面向组织)三大方向
  • 层级结构:90 个 Level-1 领域,354 个 Level-2 领域

任务构建方法

基于上述分类体系,团队构建了可执行环境,并通过四种互补路径合成单轮和多轮任务:

  1. DAG(有向无环图)
  2. DAG-S
  3. Solver
  4. Program

最终数据集包含 1,431 个任务,并从中筛选出 644 个挑战性子集,以降低评估成本并缓解公开发布后的潜在数据污染问题。

评估维度

OmniaBench 引入了 十维能力分类体系八个组合原子难度因子,支持细粒度的评估与分析。

测试结果:前沿模型仍面临显著挑战

论文报告了当前最先进模型在该基准上的表现:

模型 Overall Pass@1 得分
Claude-Sonnet-5 58.54
GPT-5.6-Sol 57.14

即使是最前沿的模型,整体通过率也仅略高于 50%,表明通用 AI Agent 在多样化场景下仍存在明显的能力瓶颈。

进一步分析揭示了以下发现:

  • 不同领域之间的能力差异显著
  • 模型在 规划能力约束维护自适应纠正 方面存在持续性局限

论文信息

意义与展望

OmniaBench 为通用 AI Agent 的能力评估提供了一个广泛且具诊断性的基准框架。其分层场景分类体系和多维度能力评估机制,可为 AI 从业者和开发者提供有价值的参考,帮助识别模型在不同应用场景中的优势与短板。