返回首页






SuperCLUE
其他中文大模型测评基准,官方称以通用能力总榜与数学推理、幻觉控制、科学推理、精确指令遵循、智能体编程等分项榜单呈现模型表现,并同步给出模型价格与任务规划消耗数据。
大模型评测中文榜单模型选型
月访问量9.4 万
全球排名#341,778
月访问量为第三方平台估算,仅供参考详细介绍
SuperCLUE 是面向中文大模型的测评基准,官方提供通用能力总榜以及数学推理、幻觉控制、科学推理、精确指令遵循、智能体编程、智能体任务规划等分项榜单,同时给出模型价格与 Agentic 任务规划的 Token 消耗数据。官方说明为减少分数波动,差距在一分以内的模型按并列处理,国际模型与部分国内模型不参与排名、仅作参考。
核心能力
- 通用能力总榜:官方按总分对模型排序,并展示开放或闭源、接入方式、是否推理模型与评测日期等字段。
- 分项能力榜:官方分别给出数学推理、幻觉控制、科学推理、精确指令遵循、智能体编程与智能体任务规划等维度得分。
- 模型价格信息:官方提供 Model Pricing 板块,便于把能力得分与调用成本放在一起比较。
- Token 消耗数据:官方以 Agentic 任务规划每任务平均 Token 数呈现模型完成同类任务的消耗差异。
- 区域与接入方式筛选:官方支持按开放或闭源、接入方式筛选,帮助用户按可获取性查看结果。
- 榜单图表下载:官方称榜单结果支持下载图片,方便在汇报与材料中引用。
适合谁
- 企业选型负责人:把能力得分与价格放在一起看,避免只看单一榜单排名做决策。
- 算法工程师:用分项榜单定位模型在幻觉控制或指令遵循上的短板,决定是否需要微调。
- 产品经理:按业务场景挑选对应维度表现更好的模型,例如重推理还是重指令遵循。
- 研究或媒体从业者:引用可追溯的评测口径与评测日期,避免使用无来源的排名。
- 关注推理成本的团队:参考 Token 消耗数据估算智能体类应用的调用成本。
使用建议
- 先确认评测日期与模型版本,榜单排名会随模型更新频繁变动,用旧数据做结论容易误导。
- 把榜单当筛选工具而不是结论,选型前一定要用自有业务数据做小规模实测。
- 注意并列处理的规则,分差很小的模型不应被当作能力上有明显差距。
- 分项榜单要按业务权重看,客服场景更关心幻觉控制,代码场景更关心编程与指令遵循。
- 引用数据时保留评测方名称与时间,避免二次传播中丢失口径导致误读。此外,这类偏基础设施与社区型的工具,价值往往在使用一段时间后才显现:早期多花点时间熟悉它的数据结构和接口约定,后续接入自有工作流的成本会明显下降。
相似工具

FlagEval天秤
智源研究院的大模型评测体系与开放平台,官方称覆盖语言、多模态、计算机视觉与语音四类评测场景,提供排行榜、大模型角斗场与自动加人工结合的评测方法与工具集。
同标签 · 大模型评测

AI产品榜
AI 产品榜单数据平台,官方称按用户规模排 AI 产品榜、按价格排 AI 模型榜,定期发布全球总榜、国内总榜、出海总榜及各细分赛道榜与增速榜,被媒体与咨询机构广泛引用。
同分类

潞晨科技
AI 大模型开发部署平台企业,官方称以自研 Colossal-AI 覆盖训练、微调、推理与部署全链路,潞晨云提供按量计费的 GPU 算力与 Token 工厂式 MaaS 服务。
同分类

始智AI
中立开放的 AI 开源模型与智能体社区,官方称汇聚上千个开源模型、数据集与代码资源以及上百个智能体,并提供模型即服务、GPU 训练、镜像管理与 AI 应用空间等配套能力。
同分类

Artificial Analysis
独立评测 AI 模型与 API 服务商的基准站,围绕智能指数、输出速度与单任务成本横向对比,覆盖编码、语音、图像、视频等多门类榜单与搜索服务商对比。
内容相近
