CMMLU

CMMLU

中文大模型全能评测基准,涵盖67学科与本土知识

0点赞
2026-01-31
CMMLU screenshot 1
点击查看大图

全面介绍

中文大模型能力的一站式评测方案

CMMLU 是一个综合性中文评估基准,专注于衡量语言模型在真实中文语境下的知识储备与推理能力。覆盖从基础学科到高级专业水平的 67 个主题,内容跨越自然科学、人文社科及中国特有的生活规则。

💡 许多评测任务具有鲜明的中国文化背景,其答案在中国语境之外可能并不普遍适用,这使得 CMMLU 成为检验模型本土化理解能力的试金石。

✨ 核心功能

  • 实时排行榜:展示不同模型在 five-shot 与 zero-shot 设置下的性能表现,便于横向对比
  • 标准数据集:提供完整的开发集与测试集,涵盖需计算推理的自然科学、需记忆理解的人文社科等多类任务
  • 预处理工具:内置提示生成与数据格式化脚本,简化模型输入准备流程
  • 评估框架:支持多种评估模式,提供开箱即用的测试代码与结果分析工具

🚀 快速开始

四步完成模型评测:

  1. 获取数据:访问 GitHub 仓库或 Hugging Face 平台下载数据集
  2. 准备环境:安装 transformers、datasets 等依赖,克隆代码库
  3. 运行评测:使用预处理脚本准备数据,执行评估脚本生成结果
  4. 提交结果:开源模型可通过 PR 提交,未开放模型可发送邮件至维护团队

基础命令示例:

  • git clone https://github.com/haonan-li/CMMLU.git
  • python src/mp_utils/preprocess.py
  • python script/evaluate.py --model [模型名] --data_path [数据路径]

🎯 适用场景

  • 模型研发优化:测试和比较中文大模型在多任务场景下的知识掌握与推理能力
  • 教育智能辅导:基于 67 学科数据开发练习系统,为学生提供个性化学习建议
  • 文化知识传播:构建具有中国特色的问答系统,助力文化传承与普及
  • 医疗知识评估:验证模型在医学领域的专业理解与知识准确性
  • 智能客服优化:评估特定领域知识理解能力,提升垂直场景服务质量

产品评分

暂无评分
登录后即可评分
访问官网

相关产品