返回首页







AGI-Eval
研究与数据分析AGI-Eval是大模型评测社区,提供评测榜单、评测集、人机竞赛与Data Studio,以透明权威的得分帮助选型者了解各模型优劣。
大模型评测能力榜单评测集共建
详细介绍
导语:AGI-Eval是一个面向大模型的能力评测社区,提供评测榜单、评测集、人机竞赛与Data Studio等模块。它通过通用评测方案为大语言模型与多模态模型给出透明、权威的能力得分排名。社区还鼓励用户共建评测集,并联合高校与企业推动下一代评测标准的形成,帮助使用者做出更明智的模型选择。
核心能力
- 模型榜单基于通用评测方案,对大语言模型与多模态模型给出综合与各能力项得分。数据透明且定期更新。
- 评测集分为平台官方与用户自建两类,官方集覆盖多领域,用户也可贡献专业数据。共建让覆盖面更广。
- 人机竞赛让用户与大模型协作参与评测,探索下一代人机协同的评测方案。参与感与前沿性兼具。
- Data Studio支持个人贡献专业领域数据,以单条、扩写、Arena等多种方式收集。收集方式灵活多样。
- 数据审核采用机审加人审的多重机制,保障评测数据的质量与可信度。多重审核守住数据底线。
适合谁
- 模型选型者希望借助透明榜单,深入了解各模型优缺点后做出明智选择。选型不再靠感觉。
- 高校与研究机构可参与评测集共建,把专业领域知识转化为评测标准。学术积累有了出口。
- 算法工程师关注模型排名与能力项得分,用于横向比较与方案选型参考。能力项维度更精细。
- 数据贡献者能围绕五百多个任务标签,持续补充多领域多维度的评测数据。标签体系支撑细分。
- 关注AI发展的个人可参与人机评测,在体验前沿科技的同时获得回馈。体验与收益兼得。
使用建议
- 选型前先查看完整榜单,按综合分与具体能力项双重维度评估候选模型。单看总分容易误判。
- 自建评测集时遵循平台规范,借助机审加人审机制保证数据可被采信。规范是数据被采用的前提。
- 参与人机竞赛既能体验模型能力,也能为社区评测标准建设提供反馈。反馈帮助标准更完善。
- 关注合作机构与贡献者动态,及时获取新的评测集与研究方向的更新。动态更新反映前沿。
- 解读榜单得分时结合任务场景,分数高不等于在所有业务上都更合适。场景匹配才是关键。
相似工具

FlagEval天秤
智源研究院的大模型评测体系与开放平台,官方称覆盖语言、多模态、计算机视觉与语音四类评测场景,提供排行榜、大模型角斗场与自动加人工结合的评测方法与工具集。
同标签 · 大模型评测

SuperBench
清华大学基础模型研究中心联合中关村实验室发布的大模型综合能力评测榜单,以双月报告推动公平、公开、系统的大模型评测与技术进步。
同标签 · 大模型评测

SuperCLUE
中文大模型测评基准,官方称以通用能力总榜与数学推理、幻觉控制、科学推理、精确指令遵循、智能体编程等分项榜单呈现模型表现,并同步给出模型价格与任务规划消耗数据。
同标签 · 大模型评测

SEAL LLM Leaderboard
Scale AI 旗下 Labs 出品的专家驱动评测榜单,覆盖智能体编程、前沿推理与安全对齐等 20 多个基准、100 多个模型,可按能力维度分档浏览并持续更新。
同分类

Artificial Analysis
独立评测 AI 模型与 API 服务商的基准站,围绕智能指数、输出速度与单任务成本横向对比,覆盖编码、语音、图像、视频等多门类榜单与搜索服务商对比。
同分类

Kaggle
Google 旗下数据科学与 AI 社区平台,集成公开数据集、云端 Notebook、算法竞赛、预训练模型与免费课程,提供免费 GPU/TPU,覆盖从入门到前沿基准的全流程。
同分类
