工具介绍
CMMLU 是综合性的中文评估基准,专门用于评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业领域的 67 个主题。它由多所高校与机构合作构建,是目前中文大模型评测的重要参考基准之一,帮助研究者全面评估模型的中文理解水平。
核心功能
- 广泛主题覆盖:涵盖人文、社科、理工、医学、法律等 67 个主题
- 中文语境优化:题目设计贴合中文表达与知识体系
- 多层次难度:包含从常识到专业知识的多样难度
- 标准化评测:提供统一评测流程与结果对比
能帮你做什么
- 中文模型评测:全面评估大模型的中文知识与推理能力
- 模型选型:对比候选模型在中文场景的表现
- 学术研究:为中文 NLP 研究提供标准评测数据
- 能力诊断:按主题分析模型的强项与弱项
付费还是免费
- 完全免费开源:CMMLU 数据集与评测代码开源免费

AGI-Eval
AGI-Eval是上海交通大学、同济大学、华东师范大学、DataWhale等高校和机构合作发布的大模型评测社区,旨在打造

AI大学堂
AI大学堂是科大讯飞打造的在线AI学习平台,专注于人工智能领域的知识传授与技能培养。基于强大的星火大模型技术,为不同基础

AMiner
AMiner是具备我国自主知识产权的智能科技情报大数据挖掘服务平台,融合广泛而丰富的科研资源,包括6000万学者、3.2

BigModel
BigModel 是智谱推出的企业级大模型开放平台(MaaS),专注于为开发者提供 GLM 系列全栈大模型能力。BigM

C-Eval
C-Eval是适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5月份

Cohere
Cohere 是一家总部位于加拿大的企业级 AI 公司,为企业提供自然语言处理(NLP)与大语言模型相关的 API 服务
