返回首页
AGI-Eval

AGI-Eval

研究与数据分析

AGI-Eval是大模型评测社区,提供评测榜单、评测集、人机竞赛与Data Studio,以透明权威的得分帮助选型者了解各模型优劣。

大模型评测能力榜单评测集共建

详细介绍

导语:AGI-Eval是一个面向大模型的能力评测社区,提供评测榜单、评测集、人机竞赛与Data Studio等模块。它通过通用评测方案为大语言模型与多模态模型给出透明、权威的能力得分排名。社区还鼓励用户共建评测集,并联合高校与企业推动下一代评测标准的形成,帮助使用者做出更明智的模型选择。

核心能力

  • 模型榜单基于通用评测方案,对大语言模型与多模态模型给出综合与各能力项得分。数据透明且定期更新。
  • 评测集分为平台官方与用户自建两类,官方集覆盖多领域,用户也可贡献专业数据。共建让覆盖面更广。
  • 人机竞赛让用户与大模型协作参与评测,探索下一代人机协同的评测方案。参与感与前沿性兼具。
  • Data Studio支持个人贡献专业领域数据,以单条、扩写、Arena等多种方式收集。收集方式灵活多样。
  • 数据审核采用机审加人审的多重机制,保障评测数据的质量与可信度。多重审核守住数据底线。

适合谁

  • 模型选型者希望借助透明榜单,深入了解各模型优缺点后做出明智选择。选型不再靠感觉。
  • 高校与研究机构可参与评测集共建,把专业领域知识转化为评测标准。学术积累有了出口。
  • 算法工程师关注模型排名与能力项得分,用于横向比较与方案选型参考。能力项维度更精细。
  • 数据贡献者能围绕五百多个任务标签,持续补充多领域多维度的评测数据。标签体系支撑细分。
  • 关注AI发展的个人可参与人机评测,在体验前沿科技的同时获得回馈。体验与收益兼得。

使用建议

  • 选型前先查看完整榜单,按综合分与具体能力项双重维度评估候选模型。单看总分容易误判。
  • 自建评测集时遵循平台规范,借助机审加人审机制保证数据可被采信。规范是数据被采用的前提。
  • 参与人机竞赛既能体验模型能力,也能为社区评测标准建设提供反馈。反馈帮助标准更完善。
  • 关注合作机构与贡献者动态,及时获取新的评测集与研究方向的更新。动态更新反映前沿。
  • 解读榜单得分时结合任务场景,分数高不等于在所有业务上都更合适。场景匹配才是关键。