OnlySOTA

程式設計

寫程式碼、改程式碼。按評判方式分開看:自動跑測試打分,和由人在兩份答案裡二選一,結論常常不一樣。

第一 · AA
66.9%
Claude Opus 5.5 · $8.00
斬殺者 · 價格
$0.20
GPT 6 Luna
SOTA
15
得分高過斬殺者
被斬殺
41
更貴,得分卻不更高
排行 · AA 42–67% · A-CODE 1441–1831
  1. 166.9%1815
  2. 263.1%1749
  3. 361.8%1680
  4. 4上一代61.0%1625
  5. 561.0%1786
  6. 660.9%—
  7. 7上一代59.8%1592
  8. 859.7%1657
  9. 959.5%1658
  10. 1059.0%1623
  11. 1158.9%1570
  12. 12上一代58.8%1542
  13. 1358.7%1446
  14. 14上一代57.8%1620
  15. 1557.8%1638
  16. 16上一代57.6%1689
  17. 17上一代57.4%1532
  18. 1856.6%1583
  19. 1956.5%1788
  20. 20上一代56.5%1620
  21. 21上一代56.4%1695
  22. 22上一代56.1%1512
  23. 2355.8%1758
  24. 2455.0%1519
  25. 25上一代55.0%1552
  26. 26斬殺者54.6%1579
檢視 AA 的全部 124 個模型 →
斬殺線:得分 × 價格

每個點代表一個模型:越往右越貴,越往上得分越高。兩條虛線的交點是斬殺者,全場性價比最高的模型。它右下方的模型更貴,得分卻不更高,全部被斬殺;橫線以上是 SOTA,最強的一檔;左下方更便宜也更弱,是低成本之選。 斬殺線是怎麼畫的 →歷任斬殺者 →

SciCode · 刻度從 0 開始20%40%60%0$0.05$0.25$1.00$5.00$20.0066.9%$8.00Claude Opus 5.5斬殺者GPT 6 Luna54.6% · $0.20SOTA低成本被斬殺Blended Price, USD per 1M tokens (3:1 input:output) · log10
斬殺線前沿線:沒有哪個模型在價格和得分上同時勝過它們SOTA低成本被斬殺空心點或淺色叉:該榜的估算值

Claude Opus 5.5

anthropic/claude-opus-5-5 · 閉源 · $8.00 · SOTA

檢視完整頁面 →
各榜成績
  • Artificial Analysis LLM Leaderboard57.6第 1 名,共 374 個
  • Arena — Agent0.138第 2 名,共 51 個
  • Artificial Analysis Coding Agents0.660第 2 名,共 22 個
  • Arena — Code1815第 1 名,共 138 個
  • Arena — Text1504第 4 名,共 413 個

名次以各榜自己的為準:榜單公佈了名次就用它的,沒有公佈就按該榜的分數排序。橫條表示該模型在這個榜上領先了多大比例的模型。不同榜的分數不能相互比較。

不同推理強度下的成績

Artificial Analysis LLM Leaderboardmax 最高

  1. low42.3
  2. medium51.2
  3. high53.6
  4. xhigh56.0
  5. max57.6

只測了一檔

  • Arena — Agent · agenthigh0.138
  • Artificial Analysis Coding Agents · Claude Codemax0.660
  • Arena — Codemax1815
  • Arena — Texthigh1504

同一個模型在不同推理強度下的成績。長條從 0 畫到該榜的最高分,請逐榜閱讀,不要跨榜比較。

這個場景參考哪些榜

每一欄都是一張榜單公佈的原始排名,不取平均。兩欄結論不一致,通常是因為測的本來就不是同一件事。

自動評分

按測試或標準答案自動打分,不經過人工評判,也不經過代理迴圈,直接衡量模型寫出的程式碼。

網頁開發

由人在兩個已完成的網頁應用程式之間選出更好的一個。Arena 的 Code Arena 全部是網頁開發任務,所以這裡按它實際測的內容,稱為網頁開發榜。