Terminal-Bench 4.0
按 Terminal-Bench (Stanford, Laude Institute) 發布的原樣呈現,指標和模型都以它為準。點模型名檢視本站詳情,點箭頭回到原榜單。
- 授權條款
- 未註明
- 更新頻率
- 持續更新
- 本站抓取時間
- 2026-10-07
- 條目數
- 35
- Claude Opus 5.5
64.8%
- Claude Sonnet 5.5
61.8%
- GPT 6 Astra
58.2%
- GPT 6.1 Sol
58.2%
- Claude Fable 5.1
57.9%
- Claude Opus 5
53.9%
- GPT 6 Sol
49.4%
- Claude Fable 5
44.5%
- GLM 5.3
41.8%
- Grok 4.7
37.6%
- GPT 5.6 Sol
37.3%
- GLM 5.3 Flash
35.8%
35 個有分數
| # | 模型 | ||
|---|---|---|---|
| 1 | 64.8%61.7–68.0 | $14.30 | |
| 2 | 61.8%58.9–64.8 | $22.22 | |
| 3 | 58.2%55.4–61.0 | $9.90 | |
| 4 | 58.2%55.1–61.3 | $1.92 | |
| 5 | 57.9%54.1–61.6 | $18.92 | |
| 6 | 57.9%54.5–61.2 | $14.76 | |
| 7 | 57.9%54.9–60.8 | $6.88 | |
| 8 | 57.9%55.2–60.6 | $7.12 | |
| 9 | 54.5%51.1–58.0 | $12.08 | |
| 10 | 54.2%51.6–56.9 | $5.80 | |
| 11 | 53.9%50.5–57.3 | $8.58 | |
| 12 | 53.9%50.8–57.1 | $18.44 | |
| 13 | 51.8%48.4–55.2 | $18.09 | |
| 14 | 50.6%47.9–53.4 | $4.72 | |
| 15 | 50.3%46.6–54.0 | $14.13 | |
| 16 | 49.4%46.2–52.6 | $4.40 | |
| 17 | 44.9%41.0–48.7 | $9.67 | |
| 18 | 44.5%40.7–48.4 | $22.02 | |
| 19 | 43.3%39.7–46.9 | $7.15 | |
| 20 | 41.8%38.6–45.1 | $8.27 | |
| 21 | 37.6%34.0–41.1 | $11.16 | |
| 22 | 37.3%33.5–41.1 | $7.70 | |
| 23 | 35.8%32.2–39.3 | $8.74 | |
| 24 | 34.9%30.9–38.8 | $7.25 | |
| 25 | 27.0%23.2–30.8 | $14.05 | |
| 26 | 23.6%20.1–27.2 | $19.64 | |
| 27 | 21.5%18.3–24.8 | $5.25 | |
| 28 | 20.3%17.2–23.4 | $10.88 | |
| 29 | 19.1%15.7–22.4 | $5.54 | |
| 30 | 17.3%14.4–20.1 | $1.05 | |
| 31 | 16.4%13.6–19.1 | $0.22 | |
| 32 | 14.6%11.6–17.5 | — | |
| 33 | 12.4%9.8–15.0 | $6.35 | |
| 34 | 12.4%9.4–15.5 | $29.10 | |
| 35 | 11.2%8.8–13.7 | $3.82 |
每一列測的是什麼
- Terminal-Bench 4.0
- 越高越好 · 代理式程式設計
- Cost per trial
- 越低越好