OnlySOTA

AI 代理

不只回答一輪,而是藉助工具把一件事辦完。這裡回答兩個問題:派哪個模型上場,用哪個框架驅動它。

第一 · AA
63.6%
Claude Sonnet 5.5 · $4.00
斬殺者 · 價格
$0.17
MiMo V2.6 Flash
SOTA
18
得分高過斬殺者
被斬殺
39
更貴,得分卻不更高
排行 · AA 1–64% · AA-CODE 0.42–0.68 · A-AGENT -0.02–0.16
  1. 163.6%0.6840.125
  2. 259.6%0.6600.138
  3. 359.6%0.6160.123
  4. 457.1%0.6380.076
  5. 556.1%0.6290.112
  6. 655.1%0.6220.143
  7. 7上一代49.0%0.5970.087
  8. 8上一代43.9%0.5670.097
  9. 9上一代42.4%—0.082
  10. 1041.9%0.5360.024
  11. 11上一代39.9%0.5460.065
  12. 1238.9%0.4330.025
  13. 1335.4%—0.004
  14. 1434.8%—0.033
  15. 15新上榜33.3%——
  16. 1633.3%0.5430.040
  17. 1733.3%—0.005
  18. 1832.8%—-0.004
  19. 1926.8%—0.040
  20. 20新上榜26.8%——
  21. 2125.8%0.5630.040
  22. 2225.3%—-0.007
  23. 23斬殺者22.7%—-0.006
檢視 AA 的全部 118 個模型 →
斬殺線:得分 × 價格

每個點代表一個模型:越往右越貴,越往上得分越高。兩條虛線的交點是斬殺者,全場性價比最高的模型。它右下方的模型更貴,得分卻不更高,全部被斬殺;橫線以上是 SOTA,最強的一檔;左下方更便宜也更弱,是低成本之選。 斬殺線是怎麼畫的 →歷任斬殺者 →

Terminal-Bench 4.0 · 刻度從 0 開始20%40%60%0$0.05$0.25$1.00$20.0063.6%$4.00Claude Sonnet 5.5斬殺者MiMo V2.6 Flash22.7% · $0.17SOTA低成本被斬殺Blended Price, USD per 1M tokens (3:1 input:output) · log10
斬殺線前沿線:沒有哪個模型在價格和得分上同時勝過它們SOTA低成本被斬殺空心點或淺色叉:該榜的估算值

Claude Sonnet 5.5

anthropic/claude-sonnet-5-5 · 閉源 · $4.00 · SOTA

檢視完整頁面 →
各榜成績
  • Artificial Analysis LLM Leaderboard56.0第 2 名,共 374 個
  • Arena — Agent0.125第 3 名,共 51 個
  • Artificial Analysis Coding Agents0.684第 1 名,共 22 個
  • Arena — Code1786第 3 名,共 138 個
  • Arena — Text1471第 45 名,共 413 個
  • Arena — Vision1268第 35 名,共 159 個

名次以各榜自己的為準:榜單公佈了名次就用它的,沒有公佈就按該榜的分數排序。橫條表示該模型在這個榜上領先了多大比例的模型。不同榜的分數不能相互比較。

不同推理強度下的成績

Artificial Analysis LLM Leaderboardmax 最高

  1. low35.9
  2. medium40.8
  3. high46.8
  4. xhigh51.9
  5. max56.0

Artificial Analysis Coding Agents · Claude Codemax 最高

  1. low0.421
  2. medium0.459
  3. high0.550
  4. xhigh0.629
  5. max0.684

Arena — Codexhigh 最高

  1. high1715
  2. xhigh1786

只測了一檔

  • Arena — Agent · agentmax0.125
  • Arena — Textxhigh1471
  • Arena — Visionxhigh1268

同一個模型在不同推理強度下的成績。長條從 0 畫到該榜的最高分,請逐榜閱讀,不要跨榜比較。

這個場景參考哪些榜

每一欄都是一張榜單公佈的原始排名,不取平均。兩欄結論不一致,通常是因為測的本來就不是同一件事。

模型

比較模型本身,不論由什麼框架驅動。Artificial Analysis 按完成的任務打分;Arena 根據真實使用中的工具呼叫可靠性、任務完成度和指令遵循度打分。

執行框架

同一批資料換個角度看:比較的是驅動模型的代理框架。HarnessTax 讓每個模型在每個框架裡都跑一遍,所以兩行之間的差距只來自框架;Artificial Analysis 覆蓋的框架更多,但大多只搭配自家廠商的模型。