CMMLU中文评测基准
大规模多任务语言理解能力测试

覆盖67个学科领域的中文AI能力评估体系,全面测试大语言模型在STEM、人文科学、 社会科学及中国特定知识领域的理解与推理能力,为中文人工智能发展提供权威评测标准。

全方位AI能力评估体系

从基础学科到高级专业水平,CMMLU为大语言模型提供完整的中文多任务语言理解评测方案

STEM领域深度评测

覆盖初等数学、高等数学、物理、化学、生物、地理等科学学科,测试大语言模型在逻辑推理、科学计算和专业知识掌握方面的中文AI能力,确保模型具备扎实的理工科基础。

人文社科全面评估

涵盖中国历史、世界历史、政治、法律、经济、心理学、哲学等人文社会科学领域,评估模型对文化背景、社会规则和价值观念的中文理解与推理能力。

专业知识精准测试

包含医学、农业、计算机科学、会计学等专业领域知识,针对特定行业的专业术语和应用场景设计评测题目,检验大语言模型在垂直领域的专业中文理解水平。

中国特定知识覆盖

聚焦中国语言文化、传统习俗、法律法规、地理环境等本土特色内容,专门测试AI模型对中国社会文化背景的理解深度,弥补国际评测基准在中文语境下的不足。

灵活评测模式支持

支持zero-shot和few-shot两种评测方式,提供开发集、验证集和测试集的完善划分,便于研究者进行标准化的大语言模型能力对比与人工智能基准测试。

学术研究权威标准

由上海交通大学和麻省理工学院等顶尖研究机构联合开发,被ACL、EMNLP等顶级会议广泛引用,为中文自然语言处理领域提供权威的多任务语言理解评估标准。

数据集规模统计

用数据体现CMMLU评测基准的全面性与权威性

67

覆盖学科领域

11,528

评测问题总数

5

大类知识领域

开源

学术研究使用

准备好测试您的大语言模型中文能力了吗?

加入全球顶尖AI研究团队的行列,使用CMMLU基准评估您的人工智能模型在中文多任务语言理解方面的真实水平

立即获取数据集