LLMEval3

LLMEval3

复旦出品,专业深度的AI评测标杆

0点赞
2026-01-31

全面介绍

✨ 深耕专业领域,度量AI真知

LLMEval-3 来自复旦大学 NLP 实验室,是一套专注于专业知识深度的大模型评测基准。这里不只是一份题库,更是衡量 AI 学科素养的精细标尺,帮助您洞察模型在真实专业场景中的理解与生成能力。


🎯 全学科覆盖的评测维度

严格依据教育部学科分类标准,构建起层次分明的知识评估体系:

  • 13个一级学科门类:涵盖哲学、经济学、法学、教育学、文学、历史学、理学、工学、农学、医学、军事学、管理学、艺术学
  • 50余个二级学科:细分至专业领域,确保评测的颗粒度与学科针对性
  • 约20万道生成式问答:覆盖从基础概念到高阶应用的标准化题目,深度检验模型的专业输出质量
💡 评测特别关注哲学、理学、工学、医学等核心领域,重视模型在专业语境下的逻辑推演、知识运用与生成准确性。

💡 适用于精准评估场景

为研究者和企业开发者提供细粒度、可量化的评估参考,助力精准测试模型在特定学科领域的专业深度,发现优势与潜在提升空间。

产品评分

暂无评分
登录后即可评分
访问官网

相关产品