OmniaBench:面向通用 AI Agent 的多场景基准测试揭示前沿模型局限
引言
2026 年 7 月 16 日,Chengyu Shen 等 16 位研究人员在 arXiv 上发布了 OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios(arXiv:2607.14989)。该论文提出了一套面向通用 AI Agent 的综合基准测试框架,旨在系统性地评估大语言模型从"文本生成器"向"通用智能体"演进过程中的真实能力边界。
研究背景与核心问题
随着大语言模型逐渐具备理解用户请求、调用外部工具和通过交互完成复杂任务的能力,AI Agent 的评估需求日益迫切。然而,现有基准测试往往局限于特定场景、工具生态或交互格式,难以刻画模型在不同异构应用环境下的综合能力。
OmniaBench 的提出正是为了解决这一痛点,提供一个广泛且具诊断性的评估框架。
架构设计
场景知识体系
研究团队从应用商店、产品文档、行业资源、网络检索以及人工完善等多个来源提取面向应用的场景知识,构建了分层分类体系:
- 覆盖范围:ToC(面向消费者)、ToB(面向企业)、ToE(面向组织)三大方向
- 层级结构:90 个 Level-1 领域,354 个 Level-2 领域
任务构建方法
基于上述分类体系,团队构建了可执行环境,并通过四种互补路径合成单轮和多轮任务:
- DAG(有向无环图)
- DAG-S
- Solver
- Program
最终数据集包含 1,431 个任务,并从中筛选出 644 个挑战性子集,以降低评估成本并缓解公开发布后的潜在数据污染问题。
评估维度
OmniaBench 引入了 十维能力分类体系 和 八个组合原子难度因子,支持细粒度的评估与分析。
测试结果:前沿模型仍面临显著挑战
论文报告了当前最先进模型在该基准上的表现:
| 模型 | Overall Pass@1 得分 |
|---|---|
| Claude-Sonnet-5 | 58.54 |
| GPT-5.6-Sol | 57.14 |
即使是最前沿的模型,整体通过率也仅略高于 50%,表明通用 AI Agent 在多样化场景下仍存在明显的能力瓶颈。
进一步分析揭示了以下发现:
- 不同领域之间的能力差异显著
- 模型在 规划能力、约束维护 和 自适应纠正 方面存在持续性局限
论文信息
- 标题:OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios
- arXiv 编号:2607.14989
- 提交时间:2026 年 7 月 16 日
- 作者:Chengyu Shen 等 16 位研究人员
- 分类:Computation and Language (cs.CL) / Artificial Intelligence (cs.AI)
- 链接:https://arxiv.org/abs/2607.14989
- DOI:https://doi.org/10.48550/arXiv.2607.14989
意义与展望
OmniaBench 为通用 AI Agent 的能力评估提供了一个广泛且具诊断性的基准框架。其分层场景分类体系和多维度能力评估机制,可为 AI 从业者和开发者提供有价值的参考,帮助识别模型在不同应用场景中的优势与短板。