工具介绍
LMArena(LMSYS Chatbot Arena)是加州大学伯克利分校推出的创新 AI 模型评估平台,基于"匿名对战"机制让用户对不同 AI 模型的回答进行匿名投票。通过大量真实用户投票生成模型排行榜,被认为是当前最接近真实使用体验的大模型评测方式之一,为模型选型提供重要参考。
核心功能
- 匿名对战:两个匿名模型同时回答,用户投票选出更好
- 公开排行榜:基于 Elo 算法生成实时模型排名
- 多模态评测:支持文本、图像等场景的对比
- 免费体验:用户免费参与对战与体验各类模型
能帮你做什么
- 模型选型参考:通过真实用户投票数据了解模型口碑
- 免费体验模型:一次性对比体验多款前沿大模型
- 社区共建:通过投票参与评测数据建设
- 趋势观察:跟踪模型排名变化掌握行业动态
付费还是免费
- 完全免费:对战体验与排行榜免费开放

AGI-Eval
AGI-Eval是上海交通大学、同济大学、华东师范大学、DataWhale等高校和机构合作发布的大模型评测社区,旨在打造

AI大学堂
AI大学堂是科大讯飞打造的在线AI学习平台,专注于人工智能领域的知识传授与技能培养。基于强大的星火大模型技术,为不同基础

AMiner
AMiner是具备我国自主知识产权的智能科技情报大数据挖掘服务平台,融合广泛而丰富的科研资源,包括6000万学者、3.2

BigModel
BigModel 是智谱推出的企业级大模型开放平台(MaaS),专注于为开发者提供 GLM 系列全栈大模型能力。BigM

C-Eval
C-Eval是适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5月份

CMMLU
CMMLU是综合性的中文评估基准,专门用在评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业水平的67个
