OnlySOTA

Terminal-Bench 4.0

按 Terminal-Bench (Stanford, Laude Institute) 發布的原樣呈現,指標和模型都以它為準。點模型名檢視本站詳情,點箭頭回到原榜單。

發布方
Terminal-Bench (Stanford, Laude Institute)
授權條款
未註明
更新頻率
持續更新
本站抓取時間
2026-10-07
條目數
35
按 Terminal-Bench 4.0 排名前 12 的模型
  1. Claude Opus 5.5 64.8%
  2. Claude Sonnet 5.5 61.8%
  3. GPT 6 Astra 58.2%
  4. GPT 6.1 Sol 58.2%
  5. Claude Fable 5.1 57.9%
  6. Claude Opus 5 53.9%
  7. GPT 6 Sol 49.4%
  8. Claude Fable 5 44.5%
  9. GLM 5.3 41.8%
  10. Grok 4.7 37.6%
  11. GPT 5.6 Sol 37.3%
  12. GLM 5.3 Flash 35.8%

35 個有分數

#模型
1Claude Opus 5.5Claude Code · maxAnthropic64.8%61.7–68.0$14.30
2Claude Sonnet 5.5Claude Code · maxAnthropic61.8%58.9–64.8$22.22
3GPT 6 AstraCodex · maxOpenAI58.2%55.4–61.0$9.90
4GPT 6.1 SolCodex · maxOpenAI58.2%55.1–61.3$1.92
5Claude Fable 5.1Claude Code · maxAnthropic57.9%54.1–61.6$18.92
6Claude Fable 5.1Claude Code · xhighAnthropic57.9%54.5–61.2$14.76
7GPT 6 AstraCodex · highOpenAI57.9%54.9–60.8$6.88
8GPT 6 AstraCodex · xhighOpenAI57.9%55.2–60.6$7.12
9Claude Fable 5.1Claude Code · highAnthropic54.5%51.1–58.0$12.08
10GPT 6 AstraCodex · mediumOpenAI54.2%51.6–56.9$5.80
11Claude Fable 5.1Claude Code · mediumAnthropic53.9%50.5–57.3$8.58
12Claude Opus 5Claude Code · xhighAnthropic53.9%50.8–57.1$18.44
13Claude Opus 5Claude Code · maxAnthropic51.8%48.4–55.2$18.09
14GPT 6 AstraCodex · lowOpenAI50.6%47.9–53.4$4.72
15Claude Opus 5Claude Code · highAnthropic50.3%46.6–54.0$14.13
16GPT 6 SolCodex · maxOpenAI49.4%46.2–52.6$4.40
17Claude Opus 5Claude Code · mediumAnthropic44.9%41.0–48.7$9.67
18Claude Fable 5Claude Code · maxAnthropic44.5%40.7–48.4$22.02
19Claude Fable 5.1Claude Code · lowAnthropic43.3%39.7–46.9$7.15
20GLM 5.3Claude Code · maxZ AI41.8%38.6–45.1$8.27
21Grok 4.7Grok Build · xhighSpaceXAI37.6%34.0–41.1$11.16
22GPT 5.6 SolCodex · maxOpenAI37.3%33.5–41.1$7.70
23GLM 5.3 FlashClaude Code · offZ AI35.8%32.2–39.3$8.74
24Claude Opus 5Claude Code · lowAnthropic34.9%30.9–38.8$7.25
25Qwen 3.8 MaxClaude Code · 0902 · maxAlibaba27.0%23.2–30.8$14.05
26Claude Opus 4.8Claude Code · maxAnthropic23.6%20.1–27.2$19.64
27GPT 5.6 TerraCodex · maxOpenAI21.5%18.3–24.8$5.25
28Grok 4.6Grok Build · highSpaceXAI20.3%17.2–23.4$10.88
29Gemini 3.8 Flashmini-SWE-agent · highGoogle19.1%15.7–22.4$5.54
30GPT 5.6 LunaCodex · maxOpenAI17.3%14.4–20.1$1.05
31GPT 6 LunaCodex · maxOpenAI16.4%13.6–19.1$0.22
32Muse Spark 1.3Muse Code · xhighMeta14.6%11.6–17.5—
33Grok 4.5Grok Build · highSpaceXAI12.4%9.8–15.0$6.35
34Claude Sonnet 5Claude Code · maxAnthropic12.4%9.4–15.5$29.10
35Gemini 3.7 Flashmini-SWE-agent · highGoogle11.2%8.8–13.7$3.82

每一列測的是什麼

Terminal-Bench 4.0
越高越好 · 代理式程式設計
Cost per trial
越低越好