
点击查看大图

点击查看大图
全面介绍
C-Eval:多层次多学科的中文评估套件
C-Eval 是一个专业、全面的中文大语言模型标准化评估基准。它由上海交通大学、清华大学和爱丁堡大学的研究人员联合推出,旨在通过系统化的测试,衡量模型的中文知识理解、推理及泛化能力。
其核心在于提供包含 52 个学科、13948 道选择题的标准化量化基准,支持模型间的公平横向对比,是研发与学术研究的关键工具。
主要功能亮点 ✨
- 多学科覆盖:涵盖 STEM、社会科学、人文科学等 52 个不同学科,全面评估模型的知识储备。
- 多层次难度分级:设有四个难度级别,从基础到高级,细致考察模型在不同挑战下的推理能力。
- 量化评估与标准化测试:通过大量的选择题和标准化评分,提供清晰的性能指标,便于比较。
如何使用 C-Eval 💡
使用 C-Eval 进行评估主要包含以下几个步骤:
-
数据下载
可以从 Hugging Face 获取数据集:
使用 `load_dataset` 函数加载:
from datasets import load_dataset
dataset = load_dataset("ceval/ceval-exam", name="computer_network")或直接下载 ZIP 文件:
wget https://huggingface.co/datasets/ceval/ceval-exam/resolve/main/ceval-exam.zip
unzip ceval-exam.zip -
选择评估模式
- 零样本(Zero-shot):模型在没有任何示例的情况下直接回答问题。
- 少样本(Few-shot):模型在少量示例(如 5 个)的提示下回答问题。
-
准备模型
确保模型已加载。例如,对于 Hugging Face 模型:
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "your-model-name"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name) -
构建提示(Prompt)
根据选择的模式构建提示语。例如,零样本提示格式为:
以下是中国关于{科目}考试的单项选择题,请选出其中的正确答案。
{测试题目}
A. {选项A}
B. {选项B}
C. {选项C}
D. {选项D}
答案:少样本提示则需在测试题目前加入示例题目及答案。
-
生成回答
使用模型生成回答,并提取答案选项(如 A、B、C、D)。
inputs = tokenizer(prompt, return_tensors="pt")
outputs = model.generate(**inputs)
response = tokenizer.decode(outputs[0], skip_special_tokens=True)
answer = extract_answer(response) # 自定义函数提取答案 -
评估模型
对于验证集,可直接计算准确率:
from sklearn.metrics import accuracy_score
accuracy = accuracy_score(labels, predictions)
print(f"Validation Accuracy: {accuracy:.2f}")对于测试集,需将结果提交至官方平台获取评分。
-
提交结果
准备包含所有测试题目预测结果的 JSON 文件,并登录 C-Eval 官方平台提交以获取最终评分。
应用场景 🎯
- 语言模型性能评估:全面衡量模型的知识与推理能力,助力开发者优化性能。
- 学术研究与模型比较:为研究人员提供标准化测试平台,推动技术进步与学术分析。
- 教育领域应用开发:可用于开发智能辅导系统、自动评分工具,提升教育智能化水平。
- 行业应用优化:在金融、医疗、客服等领域,评估和优化模型的领域知识与应用效果。
- 社区合作与技术评测:作为开放基准,促进开发者交流,为模型竞赛提供公平测试工具。
产品评分
暂无评分
登录后即可评分
















