工具介绍
SuperCLUE 是针对中文大模型的综合性评测基准,由 CLUE 中文语言理解测评基准团队推出。它从语言理解、生成、推理、多模态等多个维度系统评测中文大模型的能力,并发布中文大模型排行榜,是国内大模型评测领域最具影响力的基准之一,为中文大模型的发展提供重要参考。
核心功能
- 中文专项评测:针对中文语境设计的多维度评测
- 多能力覆盖:涵盖理解、生成、推理、多模态等能力
- 公开榜单:定期发布中文大模型排行榜
- 细分场景:提供通用、应用、安全等多层次评测
能帮你做什么
- 中文模型评估:全面衡量中文大模型能力
- 模型选型:参考榜单选择适合的中文模型
- 研发对标:开发中文模型时对照评测指标
- 行业观察:掌握中文大模型发展动态
付费还是免费
- 免费为主:评测榜单与基准免费公开,定制评测服务以官方为准

AGI-Eval
AGI-Eval是上海交通大学、同济大学、华东师范大学、DataWhale等高校和机构合作发布的大模型评测社区,旨在打造

AI大学堂
AI大学堂是科大讯飞打造的在线AI学习平台,专注于人工智能领域的知识传授与技能培养。基于强大的星火大模型技术,为不同基础

AMiner
AMiner是具备我国自主知识产权的智能科技情报大数据挖掘服务平台,融合广泛而丰富的科研资源,包括6000万学者、3.2

BigModel
BigModel 是智谱推出的企业级大模型开放平台(MaaS),专注于为开发者提供 GLM 系列全栈大模型能力。BigM

C-Eval
C-Eval是适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5月份

CMMLU
CMMLU是综合性的中文评估基准,专门用在评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业水平的67个
