工具介绍
MMBench 是上海人工智能实验室、南洋理工大学等机构联合发布的多模态基准测试,用于系统评估多模态大模型的视觉理解与推理能力。它通过设计结构化的多模态评测任务,涵盖图像理解、视觉推理、OCR、图表解读等能力维度,并采用循环评测机制保证评估的可靠性与公平性,是多模态模型评测领域的重要参考基准。
核心功能
- 多模态评测:系统评估模型的图像理解与视觉推理能力
- 结构化任务:覆盖 OCR、图表、场景理解等细分能力
- 循环评测机制:通过多轮验证提高评测可靠性
- 多模型对比:在同一基准下对比多个多模态模型
能帮你做什么
- 多模态模型评估:研究者科学衡量模型的视觉理解水平
- 模型选型:对比候选多模态模型的能力表现
- 学术研究:为多模态模型研究提供标准评测数据
- 能力诊断:定位模型在视觉推理中的短板
付费还是免费
- 完全免费开源:MMBench 数据集与评测代码开源免费

AGI-Eval
AGI-Eval是上海交通大学、同济大学、华东师范大学、DataWhale等高校和机构合作发布的大模型评测社区,旨在打造

AI大学堂
AI大学堂是科大讯飞打造的在线AI学习平台,专注于人工智能领域的知识传授与技能培养。基于强大的星火大模型技术,为不同基础

AMiner
AMiner是具备我国自主知识产权的智能科技情报大数据挖掘服务平台,融合广泛而丰富的科研资源,包括6000万学者、3.2

BigModel
BigModel 是智谱推出的企业级大模型开放平台(MaaS),专注于为开发者提供 GLM 系列全栈大模型能力。BigM

C-Eval
C-Eval是适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5月份

CMMLU
CMMLU是综合性的中文评估基准,专门用在评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业水平的67个
