AGI-Eval
查AI模型真实水平,看权威榜单
由多所高校联合打造,定期发布大语言模型能力排名,提供开放数据集和人机协同评测服务

核心功能
模型能力榜单
定期发布大语言模型综合评分和细分能力排名,数据公开透明,方便对比选型
人机协同评测
采用评测人员与AI协作的模式,对模型进行深度评估,既保证科学性也促进技术优化
官方评测集
提供涉及代码、推理等多领域的专业评测数据集,支持学术研究和模型测试
用户共建社区
支持个人上传评测数据,平台拥有2万+活跃用户和500多种任务标签,数据来源广泛
数据审核机制
机器初审加人工复审双重把关,确保评测数据的质量和可靠性
产品特色
- 01
高校与社区联合构建的权威性
由上海交大、同济等高校教授团队与DataWhale社区共同发起,学术背景扎实,榜单可信度较高
- 02
首创人机协作评测模式
不同于纯自动化的榜单,让人和AI协同完成评估,能发现模型在实际使用中的细微差异
- 03
开放的数据生态
既有官方评测集供下载,也接受用户上传个人数据集,形成持续更新的评测资源池
- 04
覆盖从代码到常识的多维测试
包含信息学竞赛题等硬核评测项,也涵盖通用语言任务,对不同模型的能力画像比较全面
应用场景
✅ 模型选型参考
企业或开发者通过榜单对比不同模型在推理、代码、语言等维度的得分,选择最适配业务的模型
✅ 学术研究验证
高校和研究机构使用平台提供的评测集,在新方法或新模型上跑分,与国际公开结果做横向对比
✅ 算法优化反馈
开发者提交模型到平台评测,根据细分能力得分和错误样例,定位优化方向
✅ 数据贡献与协作
个人或团队上传专业领域的评测数据,经审核后纳入平台,丰富评测维度并获得社区认可
常见问题
解答您关于"AGI-Eval"的常见疑问,让您更好地使用这款AI工具
-
采用人机协同的评测方式,由专业评测人员与AI协作完成打分,覆盖综合能力和多项细分指标,分数越高表示该项能力越强
-
平台官方发布的评测集可查阅和下载,用于学术研究或内部测试,具体使用范围见各数据集说明
-
注册登录后,在“贡献评测集”入口提交数据,平台会经过机器和人工审核,审核通过后纳入数据池
-
平台会定期更新排名,具体更新频率视新模型发布和评测进度而定,建议关注首页公告
立即体验 AGI-Eval
AGI-Eval是由上海交通大学、同济大学等高校与DataWhale联合打造的大模型评估社区,提供权威的模型能力排名榜单和开放评测数据集。平台拥有超过20000名专业评测人员,采用人机协同评测模式,定期发布涵盖综合能力及各细分维度的模型评分。用户可贡献评测数据,也可查阅官方评测集用于学术研究或模型选型参考。