OnlySOTA

智能体

不只回答一轮,而是借助工具把一件事办完。这里回答两个问题:派哪个模型上场,用哪个框架驱动它。

第一 · AA
63.6%
Claude Sonnet 5.5 · $4.00
斩杀者 · 价格
$0.17
MiMo V2.6 Flash
SOTA
16
得分高过斩杀者
被斩杀
39
更贵,却不更强
排行 · AA 1–64% · AA-CODE 0.42–0.68 · A-AGENT -0.02–0.16
  1. 163.6%0.6840.125
  2. 259.6%0.6600.138
  3. 359.6%0.6160.123
  4. 4新上榜57.1%0.6380.076
  5. 556.1%0.6290.112
  6. 655.1%0.6220.143
  7. 7上一代49.0%0.5970.087
  8. 8上一代43.9%0.5670.097
  9. 9上一代42.4%—0.082
  10. 1041.9%0.5360.024
  11. 11上一代39.9%0.5460.065
  12. 1238.9%0.4330.025
  13. 1335.4%—0.004
  14. 1434.8%—0.033
  15. 1533.3%0.5430.040
  16. 1633.3%—0.005
  17. 1732.8%—-0.004
  18. 1826.8%—0.040
  19. 1925.8%0.5630.040
  20. 2025.3%—-0.007
  21. 21斩杀者22.7%—-0.006
查看 AA 的全部 115 个模型 →
斩杀线:得分 × 价格

每个点是一个模型:越往右越贵,越往上越强。两条虚线交汇处是斩杀者,全场性价比最高的那一个。它右下方的模型更贵却不更强,统统被斩杀;横线以上是 SOTA,最强的一档;左下方更便宜也更弱,是省钱之选。 斩杀线是怎么画的 →

Terminal-Bench 4.0 · 刻度从 0 开始20%40%60%0$0.05$0.25$1.00$20.0063.6%$4.00Claude Sonnet 5.5斩杀者MiMo V2.6 Flash22.7% · $0.17SOTA低成本被斩杀Blended Price, USD per 1M tokens (3:1 input:output) · log10
斩杀线前沿线:价格和得分都没被别的模型同时超过SOTA低成本被斩杀空心点或浅色叉:该榜的估算值

Claude Sonnet 5.5

anthropic/claude-sonnet-5-5 · 闭源 · $4.00 · SOTA

查看完整页面 →
各榜成绩
  • Artificial Analysis LLM Leaderboard56.0第 2 名,共 372 个
  • Arena — Agent0.125第 3 名,共 49 个
  • Artificial Analysis Coding Agents0.684第 1 名,共 22 个
  • Arena — Code1786第 3 名,共 109 个
  • Arena — Text1471第 45 名,共 306 个
  • Arena — Vision1268第 35 名,共 128 个

名次是各榜自己的:榜单公布了名次就用它的,没公布就按该榜分数排。进度条表示在这个榜里排在多少模型前面。不同榜的分数不能相互比较。

不同推理强度下的成绩

Artificial Analysis LLM Leaderboardmax 最高

  1. low35.9
  2. medium40.8
  3. high46.8
  4. xhigh51.9
  5. max56.0

Artificial Analysis Coding Agents · Claude Codemax 最高

  1. low0.421
  2. medium0.459
  3. high0.550
  4. xhigh0.629
  5. max0.684

Arena — Codexhigh 最高

  1. high1715
  2. xhigh1786

只测了一档的榜

  • Arena — Agent · agentmax0.125
  • Arena — Textxhigh1471
  • Arena — Visionxhigh1268

同一个模型在不同推理强度下的成绩。条形从 0 画到该榜的最高分,每个榜单独看,不要跨榜比较。

这个场景参考哪些榜

每一栏都是一张榜单的原始排名,原样照搬,不取平均。两栏结论打架,往往是因为它们测的根本不是一件事。

模型

比较模型本身。Artificial Analysis 按完成的任务打分;Arena 根据真实使用中工具调用是否可靠、任务是否完成、是否听从指挥来打分。

执行框架

同一批数据换个角度看:比较的是驱动模型的智能体框架。HarnessTax 让每个模型都在每个框架里跑一遍,两行之间的差距只来自框架;Artificial Analysis 覆盖的框架更多,但大多只配自家模型。