工具介绍
FlagEval(天秤)是北京智源人工智能研究院(BAAI)推出的科学、公正、开放的大模型评测体系及开放平台。它构建了覆盖语言、多模态、语音、视觉等领域的评测体系,提供统一评测基准、评测工具与榜单,支持模型能力对比与报告生成,是大模型评测领域的重要基础设施。
核心功能
- 多领域评测:覆盖语言理解、多模态、语音识别、视觉等多维度能力
- 统一基准:提供标准化评测数据集与评分体系
- 开放榜单:公开大模型评测结果,支持横向对比
- 评测报告:自动生成详细的能力分析报告
能帮你做什么
- 模型能力评估:研究者科学评估大模型多维度能力
- 行业选型:企业依据公开榜单选择合适模型
- 科研支撑:高校机构使用统一基准开展评测研究
- 标准建设:推动大模型评测体系的规范化
付费还是免费
- 免费开放:FlagEval 评测平台与榜单免费开放使用

AGI-Eval
AGI-Eval是上海交通大学、同济大学、华东师范大学、DataWhale等高校和机构合作发布的大模型评测社区,旨在打造

AI大学堂
AI大学堂是科大讯飞打造的在线AI学习平台,专注于人工智能领域的知识传授与技能培养。基于强大的星火大模型技术,为不同基础

AMiner
AMiner是具备我国自主知识产权的智能科技情报大数据挖掘服务平台,融合广泛而丰富的科研资源,包括6000万学者、3.2

BigModel
BigModel 是智谱推出的企业级大模型开放平台(MaaS),专注于为开发者提供 GLM 系列全栈大模型能力。BigM

C-Eval
C-Eval是适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5月份

CMMLU
CMMLU是综合性的中文评估基准,专门用在评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业水平的67个
