Google DeepMind发布新一代AI评估基准:从事实核查到策略推理的全面评测
你知道吗? 当AI开始成为我们获取信息的主要渠道时,如何判断它说的是真话还是胡编乱造?这个问题,Google DeepMind最近给出了系统性的答案。
为什么我们需要一套全新的"考试"来考AI?
想象一下,如果你要招聘一位员工,你会只考他背了多少本书吗?显然不会——你需要考察他的综合能力:记忆力、分析能力、解决问题的能力……
大语言模型(LLM)正变得越来越强大,但它们真的可靠吗?在回答事实性问题时会不会"一本正经地胡说八道"?在处理复杂任务时能不能保持逻辑清晰?这些问题需要一个全面、系统的评估体系。
于是,Google DeepMind推出了一套全新的AI评估基准测试套件,从事实准确性到策略推理,全方位检验AI的能力边界。
第一部分:AI会说真话吗?——FACTS事实性评估体系
什么是FACTS?
FACTS是首个从四个维度全面评估AI事实性的基准套件:
- 参数知识:关掉搜索引擎,AI靠自己的"记忆"能答对多少事实性问题?
- 搜索能力:给它联网权限后,它能找到准确的信息吗?
- 多模态理解:看到图片后,它能正确描述并回答问题吗?
- 事实锚定:在写长篇文章时,它的每句话都有据可查吗?
FACTS Grounding:不让AI"凭空捏造"
这个测试特别有意思——它会给AI一篇长文档,然后看它的回答是否完全基于文档内容。简单说,就是防止AI"编故事"。
📚 资源链接:
- 论文:https://arxiv.org/abs/2501.03200
- Kaggle排行榜:https://www.kaggle.com/benchmarks/google/facts-grounding
- 数据集:https://huggingface.co/datasets/google/FACTS-grounding-public
SimpleQA Verified:更精准的"是非题"测试
这是一个包含1,00道题的基准测试,专门检验AI回答简短事实性问题的能力。
为什么需要这个"升级版"?因为之前的SimpleQA基准存在一些问题:
- ❌ 有些题目本身就有错误
- ❌ 题目主题分布不均匀
- ❌ 太多重复的题目
SimpleQA Verified解决了这些问题,让研究人员能更准确地追踪AI在事实性方面的真实进步。
📚 资源链接:
- 论文:https://arxiv.org/abs/2509.07968
- Kaggle排行榜:https://www.kaggle.com/benchmarks/deepmind/simpleqa-verified
- 数据集:https://huggingface.co/datasets/google/simpleqa-verified/tree/main
第二部分:AI能完成复杂任务吗?——DeepSearchQA
如果说前面的测试是"开卷考试",那DeepSearchQA就是"综合实践考核"。
这个包含900个任务的基准测试,考察的是AI在多步骤信息检索中的表现。它的特点在于:
🔗 因果链设计:每一步的发现都是下一步的基础。就像侦探破案,前一个线索指引你找到下一个线索。
🌐 跨领域覆盖:涵盖17个不同的专业领域
🎯 长期规划能力:AI需要记住之前的发现,并据此规划下一步行动
📊 客观验证:所有任务的答案都可以被明确验证
📚 资源链接:
- Kaggle排行榜:https://www.kaggle.com/benchmarks/google/dsqa
- 示例代码:https://www.kaggle.com/code/andrewmingwang/deepsearchqa-starter-code
- 数据集:https://www.kaggle.com/datasets/deepmind/deepsearchqa/data
第三部分:AI会下棋吗?——国际象棋策略推理基准
Chess Text:看AI如何"思考"棋局
国际象棋是检验策略推理能力的经典场景。Chess Text排行榜通过贝叶斯技能评级系统,为不同AI模型提供公平的比较框架。
Chess Text Openings:开局即决战?
这个变体测试专门考察AI处理开局棋局的能力。为了让测试更贴近真实对弈:
♟️ 每场比赛从20个最受欢迎的开局之一开始
♟️ 这些开局来自Lichess平台的真实对局数据
♟️ 减少"背谱"效应,真正考验AI的推理能力
📚 资源链接:
- Chess Text排行榜:https://www.kaggle.com/benchmarks/kaggle/chess-text/leaderboard
- Chess Text数据集:https://www.kaggle.com/datasets/kaggle/chess-text-gameplay
- Chess Text Openings排行榜:https://www.kaggle.com/benchmarks/kaggle/chess-text-openings
- Chess Text Openings数据集:https://www.kaggle.com/datasets/kaggle/chess-text-openings-gameplay
第四部分:AI能记住长文本吗?——MRCR v2
MRCR v2(多轮指代消解)测试的是AI在长上下文中的推理能力。
简单来说,它会给AI一段很长的文本,然后问一些需要综合多处信息才能回答的问题。这考验的不是简单的"查找"能力,而是真正的理解和分析能力。
📚 资源链接:
- 论文:https://arxiv.org/abs/2409.12640v2
- 数据集:https://github.com/google-deepmind/eval_hub/tree/master/eval_hub/mrcr_v2
这套评估体系意味着什么?
对于AI开发者和研究者来说,这套基准测试套件提供了三个重要价值:
- 统一标尺:通过标准化的排行榜,可以客观比较不同模型的进步
- 发现短板:多维度的评估帮助识别模型在哪些具体能力上需要改进
- 推动可信AI:特别是事实性评估,有助于减少AI的"幻觉"问题,让我们能更放心地使用AI提供的信息
结语
Google DeepMind发布的这套评估基准,不仅仅是几组测试题目,更是向"更可靠、更可信赖的AI"迈出的重要一步。
毕竟,当我们越来越依赖AI时,我们需要的不只是"能说会道"的模型,更是"言之有据、思之有理"的智能伙伴。
本文基于Google DeepMind官方发布材料整理
数据来源:https://deepmind.google/research/evals/