AI 评测榜单导航

15 个常用模型评测与排行榜入口。每条都标了评什么、怎么评—— 因为人类盲测、学术基准与真实用量三种口径经常给出完全不同的排序, 不看方法只看名次很容易得出错误结论。

Artificial Analysis

独立实测

把智能水平、速度、价格放在同一张图上对比各家模型与 API 供应商。

口径:独立跑一组公开基准得出智能指数,同时实测各供应商的首字延迟、吞吐与每百万 token 价格。选型时最有参考价值的一站。

性价比延迟吞吐选型artificialanalysis.ai

LMArena(原 Chatbot Arena)

人类盲测

让人类盲测两个模型的回答并投票,用 Elo 排出高下。

口径:匿名两两对战 + Elo/Bradley-Terry 评分。反映的是「人更喜欢哪个回答」,与主观体验最接近,但也容易被讨好式语气和漂亮排版拉高。

Elo盲测主观偏好lmarena.ai

OpenRouter 排行榜

真实用量

按真实 token 消耗量排出各模型的实际使用份额。

口径:统计平台上的实际调用量,可按编程、角色扮演等场景细分。它衡量的是「大家真在用什么」,而非模型有多强。

用量市场份额趋势openrouter.ai/rankings

HuggingFace Open LLM Leaderboard

综合榜单

开源模型在一组标准学术基准上的自动化跑分。

口径:统一用 Eleuther 的评测框架跑 MMLU-Pro、GPQA、MATH、IFEval 等,全部可复现。只覆盖开放权重模型,闭源 API 不在其中。

开源模型MMLU可复现huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard

HuggingFace 榜单合集

综合榜单

各类专项榜单的入口:多模态、代码、检索、语音等。

口径:由社区维护的 Spaces 集合,每个榜单口径不同,点进去先看它的评测说明。

多模态专项社区huggingface.co/collections/open-llm-leaderboard/the-big-benchmarks-collection-64faca6335a7fc7d4ffe974a

SWE-bench

专项评测

模型能否真的修好 GitHub 上的真实 issue。

口径:给定仓库与 issue,让模型产出补丁,用项目自带测试判定是否通过。是目前最贴近「工程可用性」的代码评测。

代码Agent真实任务www.swebench.com

Terminal-Bench

专项评测

Agent 在真实终端里干活:编译代码、配服务器、训模型、调试系统。

口径:每个任务给一个 Docker 环境和一句自然语言指令,Agent 自己敲命令,最后用脚本检查系统状态是否达标。2.0 / 2.1 是重新精选的困难集,与 1.0 的分数不可横向比较,引用时务必带版本号。

终端Agent工程任务www.tbench.ai/leaderboard

OSWorld-Verified

专项评测

Agent 在真实操作系统里点鼠标、敲键盘,跨多个软件完成任务。

口径:在真实 Ubuntu 桌面里操作 GIMP、LibreOffice、VS Code 等,用脚本检查最终文件与系统状态判分。Verified 榜要求官方在统一环境里复跑后才收录,比各家自己报的数字可信得多。

Computer UseGUIAgentosworld-v1.xlang.ai

PaperBench

专项评测

Agent 能不能从零复现一篇 ICML 论文:读懂方法、写出代码、跑出结果。

口径:20 篇 ICML 2024 Spotlight/Oral,拆成 8000 多条与论文原作者共同拟定的评分点,由 LLM 裁判逐条打分。单篇要跑几十小时,衡量的是长时程自主研究能力。没有实时榜单,分数需查论文与各家模型卡。

科研复现长时程Agentopenai.com/index/paperbench/

MMMU-Pro

专项评测

多模态模型在 30 个学科图文题上的真实理解力。

口径:在 MMMU 基础上剔掉纯文本模型也能猜对的题、增加干扰选项,并新增「题干也画进图里」的纯视觉模式。分数普遍比 MMMU 低十几到二十几分,两者不要混着引用。

多模态学科推理抗捷径mmmu-benchmark.github.io

OCRBench v2

专项评测

多模态模型的 OCR 硬实力:认字、定位、解析版面、读懂表格与公式。

口径:1 万条人工校验的中英题目,覆盖 23 类任务、31 种场景,要求输出 Markdown / JSON / LaTeX 等结构化结果。中英文分开排名,做文档处理选型时比通用多模态榜更有针对性。

OCR文档解析中英双语99franklin.github.io/ocrbench_v2/

LiveBench

专项评测

每月更新题目的抗污染综合评测。

口径:题目持续替换并保持不公开答案,专门对抗「训练集里见过原题」的问题,客观自动判分。

抗污染月更客观判分livebench.ai

ARC Prize(ARC-AGI)

专项评测

在没见过的抽象推理题上,模型还能不能举一反三。

口径:网格式抽象推理题,训练数据几乎无法覆盖,用来衡量泛化而非记忆。分数普遍远低于其它榜单,别拿来横向比较。

推理泛化AGIarcprize.org/leaderboard

Vellum LLM 排行榜

综合榜单

把各家公布的基准分数、上下文长度与价格整理成一张对照表。

口径:汇总官方发布数据而非自行复测,胜在信息集中、更新快,适合快速查规格。

规格对照价格上下文www.vellum.ai/llm-leaderboard

Aider 代码编辑排行榜

专项评测

模型按指令改代码时,能否严格产出可用的编辑格式。

口径:实测在真实仓库里做编辑任务的成功率,同时考察指令遵循与 diff 格式正确性 —— 这两点决定了它在编程 Agent 里好不好用。

代码编辑指令遵循Agentaider.chat/docs/leaderboards/

怎么读这些榜单

  • 同一个模型在不同榜单上排名差很多是正常的:盲测评的是「讨不讨人喜欢」,学术基准评的是「会不会做题」,用量榜评的是「便不便宜好不好接」。
  • 留意评测时间与模型版本号。厂商经常在同一个名字下静默更新权重,几周前的分数未必还成立。
  • 警惕数据污染:公开已久的基准很可能已进入训练集,抗污染设计(LiveBench)或私有测试集的结果更可信。
  • 选型时把「能力」和「成本」分开看:先用榜单圈定能力够用的几个候选,再用 Artificial Analysis 比价格与延迟。