工具介绍
PubMedQA 是专门面向生物医学领域的研究问答数据集,用于评估大语言模型在生物医学问题上的理解与推理能力。数据集基于 PubMed 论文摘要构建,包含大量人工标注的问答样本,考察模型在医学知识问答、文献理解与推理方面的表现,是生物医学 NLP 领域的重要评测基准。
核心功能
- 生物医学问答:覆盖医学知识与文献理解的问答评测
- 人工标注样本:高质量标注数据保证评测可靠性
- 推理评估:考察模型在医学推理中的表现
- 基准评测:用于对比医学领域大模型能力
能帮你做什么
- 医学模型评估:研究者衡量模型的生物医学能力
- 医学 AI 研究:为医疗大模型研究提供标准基准
- 模型选型:评估模型在医学场景的可用性
- 学术引用:论文研究中使用的权威数据集
付费还是免费
- 完全免费开源:PubMedQA 数据集公开免费使用

AGI-Eval
AGI-Eval是上海交通大学、同济大学、华东师范大学、DataWhale等高校和机构合作发布的大模型评测社区,旨在打造

AI大学堂
AI大学堂是科大讯飞打造的在线AI学习平台,专注于人工智能领域的知识传授与技能培养。基于强大的星火大模型技术,为不同基础

AMiner
AMiner是具备我国自主知识产权的智能科技情报大数据挖掘服务平台,融合广泛而丰富的科研资源,包括6000万学者、3.2

BigModel
BigModel 是智谱推出的企业级大模型开放平台(MaaS),专注于为开发者提供 GLM 系列全栈大模型能力。BigM

C-Eval
C-Eval是适用于大语言模型的多层次多学科中文评估套件,由上海交通大学、清华大学和爱丁堡大学研究人员在2023年5月份

CMMLU
CMMLU是综合性的中文评估基准,专门用在评估语言模型在中文语境下的知识和推理能力,涵盖从基础学科到高级专业水平的67个
