返回首页





详细介绍
SuperBench 是由清华大学基础模型研究中心联合中关村实验室发布的大模型综合能力评测榜单。它致力于打造公平、公正、公开、系统的评测体系,以双月级报告推动国内大模型研究与应用进步,是独立的第三方非盈利性机构,过程可追溯。
核心能力
- 由清华与中关村实验室联合发布,是独立的第三方非盈利性评测机构,过程可追溯,结论更可信。
- 率先提出五项大模型原生评测基准,并构建检测平台与自研裁判模型 CritiqueLLM,评测更科学。
- 开放性结合开源与闭源数据集,后续推出公开验证集与封闭测试集防止刷题,兼顾优化与防作弊。
- 动态性体现在定期刷新题目与类型,避免静态考题导致的过拟合与作弊,榜单更经得起时间。
- 科学性基于公平公开原则设计整套评测体系,确保结果客观可靠,方法可复现。
- 评测结果以双月级报告对外发布,并持续跟踪新的主流开源与闭源模型,保持时效性,也方便横向回溯历史表现。
适合谁
- 大模型研发团队,可用榜单横向对比主流开源与闭源模型能力,定位自家模型位置。
- 选型中的企业,可参考评测结果挑选适合自身场景的模型,减少试错成本。
- 高校与研究机构,能基于公开基准开展模型研究与教学,把评测当标尺。
- 关注行业动态的从业者,可跟踪双月级报告了解技术走向,把握演进节奏。
- 需要第三方背书的采购方,可借权威榜单降低选型风险,决策更有依据,也便于向上汇报。
使用建议
- 先看最新榜单与评测数据集,明确各模型在不同基准上的表现,再下判断。
- 结合自身任务对照原生评测基准,避免只看总分下结论,场景匹配才重要。
- 关注动态发布的题目更新,理解榜单防过拟合的设计意图,正确解读分数。
- 需要深入评估时可联系团队加入评测,获取更贴合的测试结果,而非只看公开榜。
- 把双月报告当作周期参考,持续跟踪模型能力的演进趋势,把握升级窗口。
- 借助公开验证集做模型优化,但避免在封闭测试集上直接刷题,守住评测公正。
相似工具

AGI-Eval
AGI-Eval是大模型评测社区,提供评测榜单、评测集、人机竞赛与Data Studio,以透明权威的得分帮助选型者了解各模型优劣。
同标签 · 大模型评测

FlagEval天秤
智源研究院的大模型评测体系与开放平台,官方称覆盖语言、多模态、计算机视觉与语音四类评测场景,提供排行榜、大模型角斗场与自动加人工结合的评测方法与工具集。
同标签 · 大模型评测

SuperCLUE
中文大模型测评基准,官方称以通用能力总榜与数学推理、幻觉控制、科学推理、精确指令遵循、智能体编程等分项榜单呈现模型表现,并同步给出模型价格与任务规划消耗数据。
同标签 · 大模型评测

Artificial Analysis
独立评测 AI 模型与 API 服务商的基准站,围绕智能指数、输出速度与单任务成本横向对比,覆盖编码、语音、图像、视频等多门类榜单与搜索服务商对比。
同分类

SEAL LLM Leaderboard
Scale AI 旗下 Labs 出品的专家驱动评测榜单,覆盖智能体编程、前沿推理与安全对齐等 20 多个基准、100 多个模型,可按能力维度分档浏览并持续更新。
同分类

魔搭 ModelScope
阿里达摩院发起的开源模型社区,汇集最新模型、数据集与创空间,覆盖视觉、NLP、语音、多模态与科学计算,提供推理、微调、在线算力与 AIGC 专区。
同分类

