
点击查看大图
全面介绍
中文大模型能力的一站式评测方案
CMMLU 是一个综合性中文评估基准,专注于衡量语言模型在真实中文语境下的知识储备与推理能力。覆盖从基础学科到高级专业水平的 67 个主题,内容跨越自然科学、人文社科及中国特有的生活规则。
💡 许多评测任务具有鲜明的中国文化背景,其答案在中国语境之外可能并不普遍适用,这使得 CMMLU 成为检验模型本土化理解能力的试金石。
✨ 核心功能
- 实时排行榜:展示不同模型在 five-shot 与 zero-shot 设置下的性能表现,便于横向对比
- 标准数据集:提供完整的开发集与测试集,涵盖需计算推理的自然科学、需记忆理解的人文社科等多类任务
- 预处理工具:内置提示生成与数据格式化脚本,简化模型输入准备流程
- 评估框架:支持多种评估模式,提供开箱即用的测试代码与结果分析工具
🚀 快速开始
四步完成模型评测:
- 获取数据:访问 GitHub 仓库或 Hugging Face 平台下载数据集
- 准备环境:安装 transformers、datasets 等依赖,克隆代码库
- 运行评测:使用预处理脚本准备数据,执行评估脚本生成结果
- 提交结果:开源模型可通过 PR 提交,未开放模型可发送邮件至维护团队
基础命令示例:
- git clone https://github.com/haonan-li/CMMLU.git
- python src/mp_utils/preprocess.py
- python script/evaluate.py --model [模型名] --data_path [数据路径]
🎯 适用场景
- 模型研发优化:测试和比较中文大模型在多任务场景下的知识掌握与推理能力
- 教育智能辅导:基于 67 学科数据开发练习系统,为学生提供个性化学习建议
- 文化知识传播:构建具有中国特色的问答系统,助力文化传承与普及
- 医疗知识评估:验证模型在医学领域的专业理解与知识准确性
- 智能客服优化:评估特定领域知识理解能力,提升垂直场景服务质量
产品评分
暂无评分
登录后即可评分
















