返回首页

Artificial Analysis
研究与数据分析独立评测 AI 模型与 API 服务商的基准站,围绕智能指数、输出速度与单任务成本横向对比,覆盖编码、语音、图像、视频等多门类榜单与搜索服务商对比。
评测基准模型对比
月访问量769 万
月访问量为第三方平台估算,仅供参考详细介绍
Artificial Analysis 是一个独立评测 AI 模型与 API 服务商的基准网站,帮助使用者理解当前 AI 格局,为自己的场景挑选最合适的模型与供应商。它不依赖厂商自报数据,而是围绕质量、价格、输出速度与延迟等关键指标独立跑分,并同时覆盖模型本身和提供 API 托管的服务商。官网以「Independent analysis of AI」为口号,数据持续更新,是模型选型时常用的第三方参考,也常被评测与媒体引用。
核心能力
- 智能指数(Intelligence Index):自建的综合智能评分体系,给模型能力打分并持续更新;官网公开指数版本变更说明(例如最新版本用新基准替换旧任务、升级终端操作类评测),保证分数反映前沿能力,也方便追溯。
- 成本对比:提供「每完成一次智能指数任务的成本」等指标,把模型性能换算成可比的钱,让「质量 vs 预算」的权衡有量化依据。
- 速度与延迟:展示输出速度等性能指标,配合价格一起横向比较,避免「只比质量、不比成本与速度」的片面选型。
- 模型与服务商双线对比:同一模型在不同托管服务上的表现差异也能比,支持按 Open Weights(开放权重)与 Proprietary(闭源)分类浏览,方便挑选 API 供应商。
- 分门类榜单:除语言模型外,覆盖编码智能体、语音、图像、视频、推理等多个门类的榜单,满足不同应用场景的选型需求。
- 搜索索引(Search Index):新推出的搜索类 API 服务商对比,用同一套智能体评测质量、成本与速度,覆盖检索增强与智能搜索类应用场景。
适合谁
需要做模型选型的工程师与产品决策者;需要在成本与质量间权衡的创业团队与个体开发者;写评测、报告或文章需要引用第三方基准数据的分析师与媒体;以及想持续跟踪模型能力演进、关注每次指数版本变化的研究者。
注意事项
- 指数与榜单会随版本更新而变动,引用数据时务必标注版本与抓取时间,避免引用过时结论。
- 榜单是「通用能力」的近似,不代表你的具体任务表现;编程、写作、长上下文等细分场景建议再看对应门类的专门榜单。
- 价格与速度数据通常基于官方定价与公开测试,实际调用成本可能因用量、区域与缓存策略而不同,最终以服务商账单为准。
- 网站以英文为主,数据展示维度较多,初次使用建议先锁定自己关心的指标(质量 / 成本 / 速度),再逐步展开对比。
使用建议
榜单适合缩小候选范围:先按自己的场景锁定门类,再在质量与「单任务成本」之间找平衡点。最终决定前,用你自己的真实任务对入围的 2-3 个模型做一轮小规模对比测试,比任何榜单都更可靠;做技术选型汇报时,注明数据来源版本与时间,能让结论更站得住脚。



