OnlySOTA

Harness 榜

Harness 是驱动模型写代码、跑任务的那层程序,比如 Claude Code、Codex、Pi。这里按各自在所选榜单上跑出的最好一组成绩排名,并注明驱动的是哪个模型:harness 的成绩,有一部分是模型挣来的。

Harness 最好的一组 AA-CODE 每任务花费
  1. 1 Claude Code Claude Sonnet 5.5 · max 强度 0.684 $14.19

    全部 9 组

  2. 2 Antigravity CLI Gemini 4 Argon 0.638 $5.84

    全部 1 组

  3. 3 Codex GPT 6.1 Sol · xhigh 强度 0.629 $1.04

    全部 12 组

  4. 4 Devin Fusion CLI Claude Fable 5.1 XHigh + SWE-2 Medium 0.617 $7.90

    全部 2 组

    • Claude Fable 5.1 XHigh + SWE-2 Medium 被斩杀 0.617 $7.90
    • GPT-6 Astra XHigh + SWE-2 Medium 被斩杀 0.589 $4.54
  5. 5 Grok Build Grok 4.7 · xhigh 强度 0.563 $8.82

    全部 2 组

    • Grok 4.7 · xhigh 强度 被斩杀 0.563 $8.82
    • Grok 4.6 · xhigh 强度 被斩杀 0.470 $3.57
  6. 6 Muse Code Muse Spark 1.3 · max 强度 0.543 $3.98

    全部 1 组

  7. 7 Opencode GLM 5.3 0.536 $4.24

    全部 1 组

  8. 8 Kimi Code CLI Kimi K3 0.519 $5.05

    全部 1 组

  9. 9 Muse Code 1.0.2 RC Muse Spark 1.3 · xhigh 强度 0.483 $3.47

    全部 1 组

  10. 10 Antigravity SDK v0.1.12 Gemini 3.8 Flash · high 强度 0.419 $2.47

    全部 1 组

发布方
Artificial Analysis
许可协议
未声明
更新频率
持续更新
本站抓取时间
2026-10-04
条目数
31 · 2 条未识别

按组合画的斩杀线

该榜标了价格的每一组「harness + 模型」:横轴是每个任务的花费,纵轴是该榜的分数。harness 自己不收费,账单大头在它驱动的模型。

Artificial Analysis Coding Agent Index · 刻度从 0 开始0.20.40.60$0.25$1.00$5.00$14.19斩杀者Codex · GPT 6.1 Sol (xhigh 强度)0.629 · $1.04SOTA低成本被斩杀Cost · log10
刻度从 0 开始0.20.40.60$0.50$5.00$14.19斩杀者Codex · GPT 6.1 Sol (xhigh 强度)SOTA低成本被斩杀Cost · log10