家族榜:每條產品線以最強模型出戰
每個家族(如 Claude Opus、GPT、Gemini Flash)由其中最強的一款代表,整行原樣取用,不做平均。點開家族,看它的每一款。
- 第一 · AA
- 57.6
- Claude Opus 5.5 · $8.00
- 斬殺者 · 價格
- $0.17
- MiMo V2.6 Flash
- SOTA
- 21
- 得分高過斬殺者
- 被斬殺
- 61
- 更貴,得分卻不更高
排行 · AA 18–58 · ARENA 1415–1534
- 1成績來自 Claude Opus 5.557.61504
- 2成績來自 GPT 6 Astra52.71477
- 3成績來自 Gemini 4 Argon52.61525
- 4成績來自 Muse Spark 1.348.11494
- 5成績來自 Grok 4.746.41442
- 646.31480
- 7成績來自 Qwen 3.8 Max45.41482
- 8成績來自 GLM 5.344.81478
- 943.71454
- 1043.61488
- 11新上榜41.1—
- 1239.51474
- 13新上榜38.4—
- 14斬殺者37.91452
斬殺線:得分 × 價格
每個點代表一個模型:越往右越貴,越往上得分越高。兩條虛線的交點是斬殺者,全場性價比最高的模型。它右下方的模型更貴,得分卻不更高,全部被斬殺;橫線以上是 SOTA,最強的一檔;左下方更便宜也更弱,是低成本之選。 斬殺線是怎麼畫的 →歷任斬殺者 →
斬殺線前沿線:沒有哪個模型在價格和得分上同時勝過它們SOTA低成本被斬殺空心點或淺色叉:該榜的估算值
Claude Opus 5.5
各榜成績
- Artificial Analysis LLM Leaderboard57.6第 1 名,共 374 個
- Arena — Agent0.138第 2 名,共 51 個
- Artificial Analysis Coding Agents0.660第 2 名,共 22 個
- Arena — Code1815第 1 名,共 138 個
- Arena — Text1504第 4 名,共 413 個
名次以各榜自己的為準:榜單公佈了名次就用它的,沒有公佈就按該榜的分數排序。橫條表示該模型在這個榜上領先了多大比例的模型。不同榜的分數不能相互比較。
不同推理強度下的成績
Artificial Analysis LLM Leaderboardmax 最高
- low42.3
- medium51.2
- high53.6
- xhigh56.0
- max57.6
只測了一檔
- Arena — Agent · agenthigh0.138
- Artificial Analysis Coding Agents · Claude Codemax0.660
- Arena — Codemax1815
- Arena — Texthigh1504
同一個模型在不同推理強度下的成績。長條從 0 畫到該榜的最高分,請逐榜閱讀,不要跨榜比較。