FlagEval
查AI模型真实力,看权威评测
由智源研究院打造,涵盖语言、多模态等四大评测领域,提供榜单、匿名对战与深度分析报告

核心功能
多领域模型榜单
定期发布语言、多模态、文生图及文生视频等领域的模型综合及专项能力排名
匿名模型对战
支持语言、图文理解、文生图、文生视频的匿名盲测,用户可直观对比并投票,结果影响最终榜单
辩论式深度评测
让两个模型围绕辩题进行多轮辩论,从逻辑、观点和论证策略上考验其综合能力
安全与价值观检测
上线专项评测功能,对模型生成内容的安全性、毒性及价值观对齐度进行系统性评估
产品特色
- 01
“能力-任务-指标”三维评测框架
从30余种能力、5大类任务和准确性、鲁棒性等指标出发,细粒度刻画模型能力边界,比单一分数更全面
- 02
全球首个含文生视频的模型对战服务
率先向用户开放包含文生视频模型的对战评测,支持Runway、可灵、即梦等国内外主流模型
- 03
首创阶梯式评分与深度思考模式
引入“远好于、略好于”等5级评分,更精确区分模型差异;并支持“深度思考”模式,让推理模型展示思维链
- 04
非营利机构背书,中立与透明
由智源研究院牵头,联合北大等高校共建,坚持匿名评测和原创数据集,确保结果公正、避免数据污染
应用场景
✅ 技术选型参考
企业或开发者通过综合榜单和专项能力评分,对比不同模型在推理、代码、多模态等维度的表现,辅助商业决策
✅ 模型迭代优化
研究人员上传新模型进行多维度评测,通过详细的诊断报告定位能力短板,针对性优化训练策略
✅ 学术研究与验证
高校和科研机构利用平台的标准评测集和辩论模式,验证新方法或新模型的性能,产出高质量论文
✅ 社区参与与洞察
普通用户可通过“角斗场”体验前沿模型,贡献自己的评测偏好,同时深入了解各模型的真实表现
常见问题
解答您关于"FlagEval"的常见疑问,让您更好地使用这款AI工具
-
FlagEval更侧重于多维度的科学评测体系,除了用户对战,还有辩论赛和专项安全评测。它也是全球首个包含文生视频模型对战的服务
-
分数结合了自动化客观评测、专家主观评估以及“大模型角斗场”中众多用户的匿名投票,力求全面、公正
-
该模式下,对战的是具备“思维链”的推理模型,你可以看到它们的推理过程(思考用时),从而评估其逻辑是否可靠
-
辩论赛让两个模型就一个话题进行多轮攻防,主要考验它们的逻辑推理、信息整合、语言表达和应变反驳能力
立即体验 FlagEval
FlagEval(天秤)是由北京智源人工智能研究院打造的大模型评测体系与开放平台。它提供涵盖语言、多模态、文生图及文生视频等领域的四大评测板块。平台首创“能力-任务-指标”三维评测框架,并推出了“大模型角斗场”这一匿名对战服务,让用户能直观对比模型表现。FlagEval坚持科学、公正、权威、开放的原则,致力于为研究人员和开发者提供专业的模型评估服务。