工具介绍
MMLU(Massive Multitask Language Understanding,大规模多任务语言理解)是衡量大语言模型综合知识水平的经典基准测试,覆盖从人文社科到理工科、法律、医学等 57 个学科领域。它通过选择题形式考察模型的广泛知识与推理能力,是目前全球大模型评测中最具影响力的基准之一,几乎所有主流大模型都会公布其 MMLU 成绩。
核心功能
- 57 个学科覆盖:涵盖人文、社科、理工、专业领域等广泛知识
- 选择题评测:通过标准化选择题衡量模型知识水平
- Few-shot 模式:支持零样本与少样本评测
- 全球基准:主流大模型均以 MMLU 作为能力对标
能帮你做什么
- 模型知识评估:客观衡量大模型的综合知识储备
- 模型对比:参考 MMLU 分数对比不同模型
- 学术研究:作为标准基准开展模型评测研究
- 能力定位:了解模型在特定学科的表现
付费还是免费
- 完全免费开源:MMLU 数据集与评测代码开源免费

AGI-Eval
AGI-Eval是上海交通大学、同济大学、华东师范大学、DataWhale等高校和机构合作发布的大模型评测社区,旨在打造

AI大学堂
AI大学堂是科大讯飞打造的在线AI学习平台,专注于人工智能领域的知识传授与技能培养。基于强大的星火大模型技术,为不同基础

AMiner
AMiner是具备我国自主知识产权的智能科技情报大数据挖掘服务平台,融合广泛而丰富的科研资源,包括6000万学者、3.2

BigModel
BigModel 是智谱推出的企业级大模型开放平台(MaaS),专注于为开发者提供 GLM 系列全栈大模型能力。BigM

C-Eval
C-Eval是适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5月份

CMMLU
CMMLU是综合性的中文评估基准,专门用在评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业水平的67个
