工具介绍
LLMEval3 是面向大语言模型的多维度评测平台,提供模型能力测试与对比服务。平台覆盖语言理解、推理、代码、知识等多个维度,提供标准化测试集与评测工具,帮助研究者和开发者全面评估大模型的综合能力,支持自定义测试与结果可视化。
核心功能
- 多维度评测:覆盖语言理解、逻辑推理、代码生成、知识问答等能力
- 标准测试集:提供统一的评测数据集
- 模型对比:在同一体系下横向对比多个模型
- 结果可视化:评测结果图表化展示,直观易懂
能帮你做什么
- 模型能力摸底:全面了解候选模型的能力边界
- 开发选型:数据驱动地选择合适的大模型
- 科研评测:为模型研究提供标准化评测手段
- 迭代验证:跟踪模型迭代后的能力变化
付费还是免费
- 免费与付费并存:基础评测免费,高级功能以官方公布为准

AGI-Eval
AGI-Eval是上海交通大学、同济大学、华东师范大学、DataWhale等高校和机构合作发布的大模型评测社区,旨在打造

AI大学堂
AI大学堂是科大讯飞打造的在线AI学习平台,专注于人工智能领域的知识传授与技能培养。基于强大的星火大模型技术,为不同基础

AMiner
AMiner是具备我国自主知识产权的智能科技情报大数据挖掘服务平台,融合广泛而丰富的科研资源,包括6000万学者、3.2

BigModel
BigModel 是智谱推出的企业级大模型开放平台(MaaS),专注于为开发者提供 GLM 系列全栈大模型能力。BigM

C-Eval
C-Eval是适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5月份

CMMLU
CMMLU是综合性的中文评估基准,专门用在评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业水平的67个
