STEM领域深度评测
覆盖初等数学、高等数学、物理、化学、生物、地理等科学学科,测试大语言模型在逻辑推理、科学计算和专业知识掌握方面的中文AI能力,确保模型具备扎实的理工科基础。
从基础学科到高级专业水平,CMMLU为大语言模型提供完整的中文多任务语言理解评测方案
覆盖初等数学、高等数学、物理、化学、生物、地理等科学学科,测试大语言模型在逻辑推理、科学计算和专业知识掌握方面的中文AI能力,确保模型具备扎实的理工科基础。
涵盖中国历史、世界历史、政治、法律、经济、心理学、哲学等人文社会科学领域,评估模型对文化背景、社会规则和价值观念的中文理解与推理能力。
包含医学、农业、计算机科学、会计学等专业领域知识,针对特定行业的专业术语和应用场景设计评测题目,检验大语言模型在垂直领域的专业中文理解水平。
聚焦中国语言文化、传统习俗、法律法规、地理环境等本土特色内容,专门测试AI模型对中国社会文化背景的理解深度,弥补国际评测基准在中文语境下的不足。
支持zero-shot和few-shot两种评测方式,提供开发集、验证集和测试集的完善划分,便于研究者进行标准化的大语言模型能力对比与人工智能基准测试。
由上海交通大学和麻省理工学院等顶尖研究机构联合开发,被ACL、EMNLP等顶级会议广泛引用,为中文自然语言处理领域提供权威的多任务语言理解评估标准。
用数据体现CMMLU评测基准的全面性与权威性
67
覆盖学科领域
11,528
评测问题总数
5
大类知识领域
开源
学术研究使用
加入全球顶尖AI研究团队的行列,使用CMMLU基准评估您的人工智能模型在中文多任务语言理解方面的真实水平
立即获取数据集