-->
alotx.ai
跨榜实测 · 2026 年 8 月 17 日

你听说的那个 AI 排行榜,
看不出模型会不会写代码

全世界引用最多的 AI 排名,叫 Arena Text——779 万人投票,391 个模型。它排的是「跟谁聊天更舒服」。而在你真正会纠结的那十几个顶级模型里,这个排名和「能不能真把活干完」几乎没有关系。同一家机构的另一个榜看得见,只是没人引用它。

先看一个具体的代价

在真实的软件任务测试里,deepseek-v4-pro 完成 63% 的任务,每个任务花 $0.24claude-sonnet-5 完成 54%,每个任务花 $26.40

又便宜 110 倍,又多做对 9 个百分点。而按聊天排名看,两者差不多。


一句话解释这两个榜在测什么

Arena Text · 大家引用的那个
给你两个匿名回答,你选哪个更好。测的是"谁说话让人更满意"。
779 万次投票 · 391 个模型
DeepSWE · 没人引用的那个
把模型丢进真实代码仓库,让它改代码,然后跑隐藏的测试。测的是"活干成了没有"。
113 个任务 · 91 个真实仓库

两个榜排出来的顺序,几乎无关

聊天排名(ARENA TEXT) 干活排名(DEEPSWE)
23 个同时出现在两个榜上的模型。左边按聊天排名,右边按实际完成率排名,同一模型连一条线。线交叉得越乱,两个榜越无关。红色是掉得最狠的,绿色是升得最猛的。

掉得最狠和升得最猛的

模型聊天名次干活名次实际是什么情况
gemini-3.1-pro823−15聊天排第 8,干活 12%,23 个里垫底
muse-spark-1.2213−11聊天亚军,干活中游
gpt-5.6-luna227+15聊天倒数第二,干活 67%,每任务 $0.61
gpt-5.6-terra184+14干活 70%,每任务 $3.96
grok-4.6196+13干活 67%
deepseek-v4-pro2110+11干活 63%,每任务 $0.24

那该看哪个数?

同一家机构 Arena 还有一个 Agent 榜——统计 179 万次真实使用中,用户有没有确认"这活干完了"、模型被回怼时能不能改对。它和三个不同的实测榜都强相关。

用它去预测…写代码读懂代码终端操作结论
Arena Text(聊天) 0.180.120.16 三个全看不见
Arena Agent(实际使用) 0.660.640.60 三个全看得见

这个数字怎么读:它叫相关系数,范围 −1 到 1。1 = 两个榜排得一模一样;0 = 完全没关系,等于抛硬币;0.6 以上 = 关系很强。0.18 基本等于没关系。

这不是"榜有噪声"

如果只是数据噪声,两个榜应该一起变差。但它们用的是同一批模型、同一个分数区间——一个全盲,一个全见。差别在于测什么,不在于测得准不准。


但别误会:聊天排名不是没用的

把弱模型也放进来一起比(从 llama-4 到 opus-4.6,跨度是前面那批的 2.5 倍),聊天排名和写代码能力的相关是 +0.83——很强

所有模型一起比
+0.83
聊天排名确实能区分强弱模型
只比顶级模型
+0.18
到了顶端就完全失灵

所以准确的说法是:聊天排名能告诉你"这个模型是不是垃圾",但没法告诉你"这几个好模型里该挑哪个"。而后者才是你实际要做的决定——没人会在 llama-2 和 opus-5 之间纠结。


这份分析没能解决什么

下面几条是这份分析自己的短板。放在这里是因为不放才叫不诚实。

给要较真的人:完整矩阵、方法、出处
Text EloAgentDeepSWE
QnA
TerminalSWE-BP
Arena Text Elo +0.39 20 +0.18 23 +0.12 14 +0.16 10 +0.83 22
Arena Agent +0.39 20 +0.66 21 +0.64 10 +0.60 8 n=2
DeepSWE(写) +0.18 23 +0.66 21 +0.50 11 +0.61 9 n=3
SWE-Atlas QnA(读) +0.12 14 +0.64 10 +0.50 11 +0.37 6 +0.94 6
Terminal-Bench 2.1 +0.16 10 +0.60 8 +0.61 9 +0.37 6 n=3
SWE-Bench Pro +0.83 22 n=2n=3 +0.94 6 n=3

ρ 后面的小字是 n,即该格建立在几个模型上。灰色格 n<10,仅为透明起见列出,不用于任何论断。

读 ≠ 写:两种不同的能力

专测「读懂代码」的 SWE-Atlas QnA 与专测「写代码」的 DeepSWE 只相关 +0.50(n=11)——远不是同一个因子。干净的双向分离:deepseek-v4-pro 读 27.1% / 写 63%;glm-5.2 读 48.1% / 写 44%。控住「写」之后,「读」对 Agent 榜仍有 +0.60 的解释力(p=0.09,n=10)。这可能解释了为什么 Agent 榜看得见而 Text 榜看不见——它把读和写都装进去了。事前已声明为探索性,样本量不足。

统计量
Spearman 秩相关;p 值用 Fisher z 变换。
配对规则
名称归一化(大小写、空格、标点);两边各取该模型自己最好的一档;配不上的直接丢弃,绝不手工牵线。完整配对表在仓库输出里逐行可查。
预注册
唯一的确证性判断(Arena Text Elo × DeepSWE)的阈值、配对规则、仪器自检与事前预测,全部在计算任何相关系数之前提交并留下 git 哈希。其余格子均为描述性。
数据来源
arena.ai · deepswe.datacurve.ai · labs.scale.com · tbench.ai,全部于 2026-08-17 当日亲手抓取,原始值与分析脚本一并存档。
已知抓取陷阱
Arena 的正负号用 ▲▼ 图标渲染,文本提取会静默丢失符号——本分析对 Agent 榜改用名次而非数值以规避。