工具介绍
AGI-Eval 是上海交通大学、同济大学、华东师范大学、DataWhale 等高校和机构合作发布的大模型基准测试与评测框架。它以全面、开放、公平为原则,覆盖多学科知识与推理能力,帮助研究者和开发者客观评估大语言模型的真实水平,是中文大模型评测领域的重要参考工具。
核心功能
- 多学科评测:覆盖数学、逻辑、常识、代码、人文社科等多学科维度
- 多任务覆盖:支持问答、推理、生成等多种任务类型评估
- 标准化评测流程:提供统一的数据集与评测脚本,结果可复现、可对比
- 开放数据:数据集与工具开源,社区可扩展与贡献
能帮你做什么
- 模型能力评估:研究者客观评估自研或开源大模型的综合能力
- 模型选型对比:开发者对比不同模型的学科表现,辅助选型决策
- 学术研究:高校与研究机构基于统一基准开展模型评测研究
- 能力短板分析:通过分科成绩定位模型的薄弱环节
付费还是免费
- 完全免费开源:AGI-Eval 基准与工具开源免费,可在 GitHub 获取

AI大学堂
AI大学堂是科大讯飞打造的在线AI学习平台,专注于人工智能领域的知识传授与技能培养。基于强大的星火大模型技术,为不同基础

AMiner
AMiner是具备我国自主知识产权的智能科技情报大数据挖掘服务平台,融合广泛而丰富的科研资源,包括6000万学者、3.2

BigModel
BigModel 是智谱推出的企业级大模型开放平台(MaaS),专注于为开发者提供 GLM 系列全栈大模型能力。BigM

C-Eval
C-Eval是适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5月份

CMMLU
CMMLU是综合性的中文评估基准,专门用在评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业水平的67个

Cohere
Cohere 是一家总部位于加拿大的企业级 AI 公司,为企业提供自然语言处理(NLP)与大语言模型相关的 API 服务
