工具介绍
OpenCompass(司南)是上海人工智能实验室推出的开源大模型评测体系,提供一站式的大模型评测解决方案。它支持语言、多模态、法律、金融等多领域评测,内置丰富的数据集与评测算法,支持模型横向对比、评测报告生成与私有化部署,是大模型评测领域广泛使用的开源工具。
核心功能
- 多领域评测:覆盖语言、多模态、法律、金融等场景
- 丰富数据集:内置 MMLU、C-Eval、MMBench 等主流基准
- 多模型对比:在同一框架下对比多个模型
- 评测报告:自动生成详细的能力分析报告
- 私有化部署:支持本地部署保障数据安全
能帮你做什么
- 模型全面评测:从多维度评估大模型能力
- 选型决策:用统一基准对比候选模型
- 合规评测:在法律、金融等领域开展专项评测
- 科研支撑:高校机构基于开源体系开展研究
付费还是免费
- 完全免费开源:OpenCompass 评测体系开源免费

AGI-Eval
AGI-Eval是上海交通大学、同济大学、华东师范大学、DataWhale等高校和机构合作发布的大模型评测社区,旨在打造

AI大学堂
AI大学堂是科大讯飞打造的在线AI学习平台,专注于人工智能领域的知识传授与技能培养。基于强大的星火大模型技术,为不同基础

AMiner
AMiner是具备我国自主知识产权的智能科技情报大数据挖掘服务平台,融合广泛而丰富的科研资源,包括6000万学者、3.2

BigModel
BigModel 是智谱推出的企业级大模型开放平台(MaaS),专注于为开发者提供 GLM 系列全栈大模型能力。BigM

C-Eval
C-Eval是适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5月份

CMMLU
CMMLU是综合性的中文评估基准,专门用在评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业水平的67个
