OnlySOTA

HarnessTax — SWE-bench Lite

按 HarnessTax (Arena) 發布的原樣呈現,指標和模型都以它為準。點模型名檢視本站詳情,點箭頭回到原榜單。

發布方
HarnessTax (Arena)
授權條款
未註明
更新頻率
已停止更新
本站抓取時間
2026-10-05
條目數
21
按 SWE-bench Lite 排名前 7 的模型
  1. Claude Fable 5 97.8%
  2. Claude Opus 4.8 88.9%
  3. GPT 5.6 Sol 77.8%
  4. Kimi K3 76.7%
  5. Claude Sonnet 4.6 68.9%
  6. Claude Haiku 4.5 60.0%
  7. GPT 5.6 Luna 55.6%

21 個有分數

#模型
1Claude Fable 5Claude CodeAnthropic97.8%93.3–100.0$1.33
2Claude Fable 5CodexAnthropic96.7%91.1–100.0$0.89
3Claude Fable 5PiAnthropic96.7%91.1–100.0$0.67
4Claude Opus 4.8CodexAnthropic88.9%77.8–97.8$0.69
5Claude Opus 4.8Claude CodeAnthropic86.7%75.6–95.6$0.98
6Claude Opus 4.8PiAnthropic82.2%71.1–92.2$0.47
7GPT 5.6 SolClaude CodeOpenAI77.8%63.3–90.0$1.54
8Kimi K3Claude CodeKimi76.7%62.2–88.9$0.78
9GPT 5.6 SolPiOpenAI74.4%58.9–88.9$0.44
10Kimi K3CodexKimi74.4%60.0–87.8$0.85
11GPT 5.6 SolCodexOpenAI73.3%57.8–87.8$0.56
12Kimi K3PiKimi72.2%57.8–85.6$0.46
13Claude Sonnet 4.6CodexAnthropic68.9%53.3–83.3$0.74
14Claude Sonnet 4.6Claude CodeAnthropic66.7%51.1–81.1$0.67
15Claude Sonnet 4.6PiAnthropic64.4%47.8–80.0$0.68
16Claude Haiku 4.5PiAnthropic60.0%43.3–75.6$0.37
17Claude Haiku 4.5CodexAnthropic57.8%41.1–74.4$0.39
18GPT 5.6 LunaClaude CodeOpenAI55.6%38.9–72.2$0.15
19GPT 5.6 LunaCodexOpenAI55.6%37.8–72.2$0.04
20GPT 5.6 LunaPiOpenAI53.3%35.6–70.0$0.03
21Claude Haiku 4.5Claude CodeAnthropic52.2%36.7–67.8$0.43

每一列測的是什麼

SWE-bench Lite
越高越好 · 代理式程式設計
Cost per rollout
越低越好