返回首页






FlagEval天秤
其他智源研究院的大模型评测体系与开放平台,官方称覆盖语言、多模态、计算机视觉与语音四类评测场景,提供排行榜、大模型角斗场与自动加人工结合的评测方法与工具集。
大模型评测评测基准开源工具
月访问量4,590
月访问量为第三方平台估算,仅供参考详细介绍
FlagEval(天秤)是智源研究院推出的大模型评测体系及开放平台,官方称旨在建立科学、公正、开放的评测基准、方法、工具集,协助研究人员全方位评估基础模型及训练算法的性能,并通过引入 AI 辅助主观评测提升评测效率与客观性。平台提供排行榜与大模型角斗场两个主要入口。
核心能力
- 语言大模型评测:官方称覆盖数学能力、代码能力、知识运用、推理能力、任务解决、指令遵循以及安全与价值观等维度。
- 多模态大模型评测:官方称考察图文分类、图文匹配与图文生成等任务,包含视觉语言模型、文生图与文生视频评测集。
- 计算机视觉评测:官方称支持主干基础模型适配评测,覆盖图像分类、图像检索、语义分割、深度估计与小样本分类等任务。
- 语音语言大模型评测:官方称覆盖语音感知、音频感知、语音生成与口语理解等十类任务,使用多个数据集与丰富指标。
- 大模型角斗场:官方称提供对抗式对比评测入口,用于收集主观偏好类评价。官方称评测体系由智源研究院推出。
- 评测工具与流程:官方称提供覆盖公开数据集与自建数据集的评测流程,结合自动评测与人工评测两种方式。官方称平台通过引入 AI 辅助主观评测提升评测效率与客观性。
适合谁
- 模型研发团队:用统一基准定位模型在不同能力维度上的位置。
- 学术研究者:引用带方法说明与数据集来源的评测结果做对比实验。官方称目标是建立科学、公正、开放的评测基准、方法、工具集。
- 企业选型人员:按业务相关维度查看模型表现,辅助采购与接入决策。
- 评测方法研究者:参考平台的评测流程设计自己的评价体系。
- 关注模型安全的人:查阅安全与价值观维度的评测结论。官方称平台提供排行榜与大模型角斗场两个主要入口。
使用建议
- 关注评测数据的发布时间与模型版本,模型迭代很快,旧结论容易失效。
- 按业务场景挑选相关维度,综合分高不等于在你的任务上表现最好。
- 自建评测集时参考其任务划分方式,覆盖基础能力与下游任务两类视角。
- 主观评测存在偏好差异,人工评测结论需要关注样本量与标注口径。
- 引用评测结果时保留平台名称与评测时间,确保结论可追溯。
相似工具

SuperCLUE
中文大模型测评基准,官方称以通用能力总榜与数学推理、幻觉控制、科学推理、精确指令遵循、智能体编程等分项榜单呈现模型表现,并同步给出模型价格与任务规划消耗数据。
同标签 · 大模型评测

SEAL LLM Leaderboard
Scale AI 旗下 Labs 出品的专家驱动评测榜单,覆盖智能体编程、前沿推理与安全对齐等 20 多个基准、100 多个模型,可按能力维度分档浏览并持续更新。
内容相近

书生·筑梦
书生·筑梦(Vchitect)是上海人工智能实验室推出的视频生成模型,官方称Vchitect 2.0支持5至20秒生成、灵活宽高比与超分插帧,并具备图生视频能力。
内容相近

OpenDataLab
上海人工智能实验室推出的开放数据平台,官方称面向国产大模型提供高质量开源数据集,支持数据集检索与下载,并配套数据标注与治理工具及开源社区能力。
同分类

PromptPilot
火山引擎推出的提示词工程平台,官方称覆盖提示词生成、调试与批量评估,支持文本理解、视觉理解与多轮对话等场景,可上传任务数据自动优化提示词并通过 API 调用。
同分类
C
CodeFuse
蚂蚁集团开源的代码大模型工具链,覆盖多任务微调框架、静态代码分析、测试智能体、语义缓存与评测基准,面向研发全生命周期,供企业与开发者自主部署使用。
内容相近
