AI 评测榜单导航
15 个常用模型评测与排行榜入口。每条都标了评什么、怎么评—— 因为人类盲测、学术基准与真实用量三种口径经常给出完全不同的排序, 不看方法只看名次很容易得出错误结论。
Artificial Analysis
独立实测把智能水平、速度、价格放在同一张图上对比各家模型与 API 供应商。
口径:独立跑一组公开基准得出智能指数,同时实测各供应商的首字延迟、吞吐与每百万 token 价格。选型时最有参考价值的一站。
LMArena(原 Chatbot Arena)
人类盲测让人类盲测两个模型的回答并投票,用 Elo 排出高下。
口径:匿名两两对战 + Elo/Bradley-Terry 评分。反映的是「人更喜欢哪个回答」,与主观体验最接近,但也容易被讨好式语气和漂亮排版拉高。
OpenRouter 排行榜
真实用量按真实 token 消耗量排出各模型的实际使用份额。
口径:统计平台上的实际调用量,可按编程、角色扮演等场景细分。它衡量的是「大家真在用什么」,而非模型有多强。
HuggingFace Open LLM Leaderboard
综合榜单开源模型在一组标准学术基准上的自动化跑分。
口径:统一用 Eleuther 的评测框架跑 MMLU-Pro、GPQA、MATH、IFEval 等,全部可复现。只覆盖开放权重模型,闭源 API 不在其中。
HuggingFace 榜单合集
综合榜单各类专项榜单的入口:多模态、代码、检索、语音等。
口径:由社区维护的 Spaces 集合,每个榜单口径不同,点进去先看它的评测说明。
SWE-bench
专项评测模型能否真的修好 GitHub 上的真实 issue。
口径:给定仓库与 issue,让模型产出补丁,用项目自带测试判定是否通过。是目前最贴近「工程可用性」的代码评测。
Terminal-Bench
专项评测Agent 在真实终端里干活:编译代码、配服务器、训模型、调试系统。
口径:每个任务给一个 Docker 环境和一句自然语言指令,Agent 自己敲命令,最后用脚本检查系统状态是否达标。2.0 / 2.1 是重新精选的困难集,与 1.0 的分数不可横向比较,引用时务必带版本号。
OSWorld-Verified
专项评测Agent 在真实操作系统里点鼠标、敲键盘,跨多个软件完成任务。
口径:在真实 Ubuntu 桌面里操作 GIMP、LibreOffice、VS Code 等,用脚本检查最终文件与系统状态判分。Verified 榜要求官方在统一环境里复跑后才收录,比各家自己报的数字可信得多。
PaperBench
专项评测Agent 能不能从零复现一篇 ICML 论文:读懂方法、写出代码、跑出结果。
口径:20 篇 ICML 2024 Spotlight/Oral,拆成 8000 多条与论文原作者共同拟定的评分点,由 LLM 裁判逐条打分。单篇要跑几十小时,衡量的是长时程自主研究能力。没有实时榜单,分数需查论文与各家模型卡。
MMMU-Pro
专项评测多模态模型在 30 个学科图文题上的真实理解力。
口径:在 MMMU 基础上剔掉纯文本模型也能猜对的题、增加干扰选项,并新增「题干也画进图里」的纯视觉模式。分数普遍比 MMMU 低十几到二十几分,两者不要混着引用。
OCRBench v2
专项评测多模态模型的 OCR 硬实力:认字、定位、解析版面、读懂表格与公式。
口径:1 万条人工校验的中英题目,覆盖 23 类任务、31 种场景,要求输出 Markdown / JSON / LaTeX 等结构化结果。中英文分开排名,做文档处理选型时比通用多模态榜更有针对性。
LiveBench
专项评测每月更新题目的抗污染综合评测。
口径:题目持续替换并保持不公开答案,专门对抗「训练集里见过原题」的问题,客观自动判分。
ARC Prize(ARC-AGI)
专项评测在没见过的抽象推理题上,模型还能不能举一反三。
口径:网格式抽象推理题,训练数据几乎无法覆盖,用来衡量泛化而非记忆。分数普遍远低于其它榜单,别拿来横向比较。
Vellum LLM 排行榜
综合榜单把各家公布的基准分数、上下文长度与价格整理成一张对照表。
口径:汇总官方发布数据而非自行复测,胜在信息集中、更新快,适合快速查规格。
Aider 代码编辑排行榜
专项评测模型按指令改代码时,能否严格产出可用的编辑格式。
口径:实测在真实仓库里做编辑任务的成功率,同时考察指令遵循与 diff 格式正确性 —— 这两点决定了它在编程 Agent 里好不好用。
怎么读这些榜单
- 同一个模型在不同榜单上排名差很多是正常的:盲测评的是「讨不讨人喜欢」,学术基准评的是「会不会做题」,用量榜评的是「便不便宜好不好接」。
- 留意评测时间与模型版本号。厂商经常在同一个名字下静默更新权重,几周前的分数未必还成立。
- 警惕数据污染:公开已久的基准很可能已进入训练集,抗污染设计(LiveBench)或私有测试集的结果更可信。
- 选型时把「能力」和「成本」分开看:先用榜单圈定能力够用的几个候选,再用 Artificial Analysis 比价格与延迟。