OnlySOTA

编程

写代码、改代码。按评判方式分开看:自动跑测试打分,和由人在两份答案里二选一,结论常常不一样。

第一 · AA
66.9%
Claude Opus 5.5 · $8.00
斩杀者 · 价格
$0.20
GPT 6 Luna
SOTA
15
得分高过斩杀者
被斩杀
39
更贵,却不更强
排行 · AA 42–67% · A-CODE 1441–1831
  1. 166.9%1815
  2. 263.1%1749
  3. 3新上榜61.8%1680
  4. 4上一代61.0%1625
  5. 561.0%1786
  6. 660.9%1618
  7. 7上一代59.8%1592
  8. 859.7%1657
  9. 959.5%1658
  10. 1059.0%1623
  11. 1158.9%1570
  12. 12上一代58.8%1542
  13. 1358.7%1446
  14. 14上一代57.8%1620
  15. 1557.8%1638
  16. 16上一代57.6%1689
  17. 17上一代57.4%1532
  18. 1856.6%1583
  19. 1956.5%1788
  20. 20上一代56.5%1620
  21. 21上一代56.4%1695
  22. 22上一代56.1%1512
  23. 2355.8%1758
  24. 2455.0%1519
  25. 25上一代55.0%1552
  26. 26斩杀者54.6%1579
查看 AA 的全部 122 个模型 →
斩杀线:得分 × 价格

每个点是一个模型:越往右越贵,越往上越强。两条虚线交汇处是斩杀者,全场性价比最高的那一个。它右下方的模型更贵却不更强,统统被斩杀;横线以上是 SOTA,最强的一档;左下方更便宜也更弱,是省钱之选。 斩杀线是怎么画的 →

SciCode · 刻度从 0 开始20%40%60%0$0.05$0.25$1.00$5.00$20.0066.9%$8.00Claude Opus 5.5斩杀者GPT 6 Luna54.6% · $0.20SOTA低成本被斩杀Blended Price, USD per 1M tokens (3:1 input:output) · log10
斩杀线前沿线:价格和得分都没被别的模型同时超过SOTA低成本被斩杀空心点或浅色叉:该榜的估算值

Claude Opus 5.5

anthropic/claude-opus-5-5 · 闭源 · $8.00 · SOTA

查看完整页面 →
各榜成绩
  • Artificial Analysis LLM Leaderboard57.6第 1 名,共 372 个
  • Arena — Agent0.138第 2 名,共 49 个
  • Artificial Analysis Coding Agents0.660第 2 名,共 22 个
  • Arena — Code1815第 1 名,共 109 个
  • Arena — Text1504第 4 名,共 306 个

名次是各榜自己的:榜单公布了名次就用它的,没公布就按该榜分数排。进度条表示在这个榜里排在多少模型前面。不同榜的分数不能相互比较。

不同推理强度下的成绩

Artificial Analysis LLM Leaderboardmax 最高

  1. low42.3
  2. medium51.2
  3. high53.6
  4. xhigh56.0
  5. max57.6

只测了一档的榜

  • Arena — Agent · agenthigh0.138
  • Artificial Analysis Coding Agents · Claude Codemax0.660
  • Arena — Codemax1815
  • Arena — Texthigh1504

同一个模型在不同推理强度下的成绩。条形从 0 画到该榜的最高分,每个榜单独看,不要跨榜比较。

这个场景参考哪些榜

每一栏都是一张榜单的原始排名,原样照搬,不取平均。两栏结论打架,往往是因为它们测的根本不是一件事。

评分

按测试或标准答案自动打分,不经过人,也不经过智能体循环,直接衡量模型写出的代码。

网页开发

由人在两个做好的网页应用之间挑更好的那个。Arena 的 Code Arena 考的全是网页开发,所以这里如实叫它网页开发榜。