
LLM Stats
研究与数据分析把 300 多个 AI 模型的智能水平、速度与价格折算成单一综合分的独立榜单,数据持续从公开基准与真实 API 指标更新,支持多任务维度排行。
详细介绍
当市面上的模型评测榜各有各的口径时,LLM Stats 的做法是把「选哪个模型」压缩成一个可比的单一分数。它覆盖 GPT、Claude、Gemini、Llama、DeepSeek 等 300 多个模型,用自建的 LLM Stats Score 综合智能、速度与价格三个维度,数据来源是公开基准加上实时 API 指标,而不是厂商自报,官方定位为独立、持续更新的 AI 排行榜,页面直接给出「用一个独立分数给最好的 AI 模型排名」的承诺。
核心能力
- 单一综合分:把智能、速度、价格等多个维度折算成一个 LLM Stats Score,省去逐项比表的麻烦,快速判断模型的整体水位与相对位置。
- 多维榜单:除总榜外,按编码、写作、数学、研究、长上下文、工具调用、推理、图像生成、视频生成等任务分榜,覆盖主流应用方向,方便按场景筛选。
- 开源模型分榜:单独列出开放权重模型的排名,方便评估可自部署、可控成本的选项,满足对数据主权有要求的团队。
- 持续更新:新模型上线后会进入榜单,并实时吸收 API 侧的速度与价格变化;页面提供新模型列表与性能指数,便于追踪最新发布。
- 配套资源:同时提供竞技场与基准数据入口,便于在单一分数之外做交叉验证,了解不同评测体系下的表现,也可实际对战测试模型,把主观体验与客观分数互相印证。
适合谁
做模型选型的工程与产品团队,需要快速判断「现在最强的是哪个」的从业者,写行业分析要引用排名数据的作者,以及想跟踪开源模型进展、评估自部署方案的开发者。
注意事项
综合分适合快速缩小候选范围,但各维度的权重是榜单方设定的,未必贴合你的具体场景;价格与速度来自实时 API 指标,会随各家定价调整而波动;公开基准数据可能存在发布滞后,对新模型的能力评估未必及时。引用排名数据时建议注明数据口径与更新时间,避免把某一时刻的排名当成永久结论。
使用建议
先用综合分锁定一个候选区间,再按自己最关心的分榜(例如编码、长上下文或推理)做第二轮筛选;实际接入前,最好用自己真实的 prompt 集做一次小规模对比,因为综合分代表平均水平,不代表在你场景里的表现。关注成本的话,可定期查看价格相关指标——模型降价后,性价比排名常会明显变化,综合分榜单能帮你及时捕捉这类机会;新模型密集发布期建议每周查看一次,及时掌握排名变化。
相似工具

Artificial Analysis
独立评测 AI 模型与 API 服务商的基准站,围绕智能指数、输出速度与单任务成本横向对比,覆盖编码、语音、图像、视频等多门类榜单与搜索服务商对比。
同标签 · 模型对比 / 基准

OpenRouter LLM Rankings
按真实调用量排名的 LLM 使用榜单,基于开发者通过 OpenRouter API 处理的 token 数统计,提供任务、成本与市场份额等多维排名,反映生产环境的真实选择。
同标签 · 排行榜

SEAL LLM Leaderboard
Scale AI 旗下 Labs 出品的专家驱动评测榜单,覆盖智能体编程、前沿推理与安全对齐等 20 多个基准、100 多个模型,可按能力维度分档浏览并持续更新。
同标签 · 排行榜

Arena
众包模式的 AI 模型竞技场,两个模型匿名对战由用户投票分胜负,并据此生成 LLM、图像与代码模型的公开排行榜,内置落地页、仪表盘、小游戏等任务模板可直接实测。
同标签 · 排行榜

魔搭 ModelScope
阿里达摩院发起的开源模型社区,汇集最新模型、数据集与创空间,覆盖视觉、NLP、语音、多模态与科学计算,提供推理、微调、在线算力与 AIGC 专区。
同分类

RunThisLLM
查询本地模型硬件需求的检索工具,索引 506 个文本、代码、图像、视频、音频与 3D 模型,可按显存与内存反查能跑什么,也可按模型反查所需配置与性能基准。
同分类
