工具介绍
HELM(Holistic Evaluation of Language Models,语言模型整体评估)是斯坦福大学基础模型研究中心推出的全面评测框架。HELM 在多个场景、多个指标维度上系统评估语言模型,包括准确性、鲁棒性、公平性、毒性等,强调评测的透明性与可复现性,是大模型评测领域的重要参考体系。
核心功能
- 多场景评测:覆盖问答、摘要、推理、代码等多种场景
- 多指标维度:评估准确性、鲁棒性、公平性、效率等指标
- 透明可复现:公开评测数据与流程,结果可复现
- 横向对比:在同一框架下对比多个模型
能帮你做什么
- 全面模型评估:研究者从多维度评估语言模型
- 可靠性研究:关注模型公平性与安全性的评估
- 学术引用:为论文与研究提供标准评测方法
- 模型选型:参考 HELM 榜单辅助选型决策
付费还是免费
- 完全免费开源:HELM 评测框架与数据开源免费

AGI-Eval
AGI-Eval是上海交通大学、同济大学、华东师范大学、DataWhale等高校和机构合作发布的大模型评测社区,旨在打造

AI大学堂
AI大学堂是科大讯飞打造的在线AI学习平台,专注于人工智能领域的知识传授与技能培养。基于强大的星火大模型技术,为不同基础

AMiner
AMiner是具备我国自主知识产权的智能科技情报大数据挖掘服务平台,融合广泛而丰富的科研资源,包括6000万学者、3.2

BigModel
BigModel 是智谱推出的企业级大模型开放平台(MaaS),专注于为开发者提供 GLM 系列全栈大模型能力。BigM

C-Eval
C-Eval是适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5月份

CMMLU
CMMLU是综合性的中文评估基准,专门用在评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业水平的67个
