工具介绍
Open LLM Leaderboard(开放大模型排行榜)是 Hugging Face 推出的开源大语言模型评测榜单,通过在统一基准上自动评测开源模型并生成排行榜,帮助社区了解各类开源大模型的真实能力。榜单覆盖 HellaSwag、MMLU、TruthfulQA 等多个评测维度,是开源大模型选型的重要参考。
核心功能
- 统一评测:在标准基准上自动评测开源模型
- 多维度指标:覆盖知识、推理、事实性等多个维度
- 公开榜单:实时更新开源模型排名
- 社区共建:开发者可提交模型参与评测
能帮你做什么
- 开源模型选型:参考榜单对比各类开源大模型
- 模型能力对比:了解模型在不同维度的表现
- 发布评估:开发者提交模型获得权威评测结果
- 社区观察:跟踪开源大模型的发展趋势
付费还是免费
- 完全免费:排行榜与评测服务免费开放

AGI-Eval
AGI-Eval是上海交通大学、同济大学、华东师范大学、DataWhale等高校和机构合作发布的大模型评测社区,旨在打造

AI大学堂
AI大学堂是科大讯飞打造的在线AI学习平台,专注于人工智能领域的知识传授与技能培养。基于强大的星火大模型技术,为不同基础

AMiner
AMiner是具备我国自主知识产权的智能科技情报大数据挖掘服务平台,融合广泛而丰富的科研资源,包括6000万学者、3.2

BigModel
BigModel 是智谱推出的企业级大模型开放平台(MaaS),专注于为开发者提供 GLM 系列全栈大模型能力。BigM

C-Eval
C-Eval是适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5月份

CMMLU
CMMLU是综合性的中文评估基准,专门用在评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业水平的67个
