OnlySOTA

HarnessTax — SWE-bench Lite

照 HarnessTax (Arena) 发布的原样呈现:它的指标,它的模型。点模型名进本站详情,点箭头回到原榜。

发布方
HarnessTax (Arena)
许可协议
未声明
更新频率
已停更
本站抓取时间
2026-10-05
条目数
21
按 SWE-bench Lite 排名前 7 的模型
  1. Claude Fable 5 97.8%
  2. Claude Opus 4.8 88.9%
  3. GPT 5.6 Sol 77.8%
  4. Kimi K3 76.7%
  5. Claude Sonnet 4.6 68.9%
  6. Claude Haiku 4.5 60.0%
  7. GPT 5.6 Luna 55.6%

21 个有分数

#模型
1Claude Fable 5Claude CodeAnthropic97.8%93.3–100.0$1.33
2Claude Fable 5CodexAnthropic96.7%91.1–100.0$0.89
3Claude Fable 5PiAnthropic96.7%91.1–100.0$0.67
4Claude Opus 4.8CodexAnthropic88.9%77.8–97.8$0.69
5Claude Opus 4.8Claude CodeAnthropic86.7%75.6–95.6$0.98
6Claude Opus 4.8PiAnthropic82.2%71.1–92.2$0.47
7GPT 5.6 SolClaude CodeOpenAI77.8%63.3–90.0$1.54
8Kimi K3Claude CodeKimi76.7%62.2–88.9$0.78
9GPT 5.6 SolPiOpenAI74.4%58.9–88.9$0.44
10Kimi K3CodexKimi74.4%60.0–87.8$0.85
11GPT 5.6 SolCodexOpenAI73.3%57.8–87.8$0.56
12Kimi K3PiKimi72.2%57.8–85.6$0.46
13Claude Sonnet 4.6CodexAnthropic68.9%53.3–83.3$0.74
14Claude Sonnet 4.6Claude CodeAnthropic66.7%51.1–81.1$0.67
15Claude Sonnet 4.6PiAnthropic64.4%47.8–80.0$0.68
16Claude Haiku 4.5PiAnthropic60.0%43.3–75.6$0.37
17Claude Haiku 4.5CodexAnthropic57.8%41.1–74.4$0.39
18GPT 5.6 LunaClaude CodeOpenAI55.6%38.9–72.2$0.15
19GPT 5.6 LunaCodexOpenAI55.6%37.8–72.2$0.04
20GPT 5.6 LunaPiOpenAI53.3%35.6–70.0$0.03
21Claude Haiku 4.5Claude CodeAnthropic52.2%36.7–67.8$0.43

每一列测的是什么

SWE-bench Lite
越高越好 · 智能体编程
Cost per rollout
越低越好