OnlySOTA

智能体

衡量一个模型带着工具把任务做完的能力,而不是一轮就答完。这里包含两个不同的选型问题:该选哪个模型来驱动,以及该用哪个执行框架去驱动它。

每一栏均按对应数据源发布的原始排名呈现,本页不做跨栏平均。若两栏结论不同,是因为它们衡量的维度不同。

模型

这一部分考察的是模型本身,无论它由什么驱动。Artificial Analysis 对完成的任务打分;Arena 观察真实会话,在自己的流量上对工具可靠性、任务完成度和可引导性评分。

Arena — Agent

Overall 数据截至 2026-08-19

  1. Claude Opus 5 0.125
  2. Claude Fable 5 (High) 0.116
  3. Kimi K3 0.104
  4. GPT-5.6 Sol 0.097
  5. Claude Opus 4.8 0.095
  6. GPT-5.5 0.085
  7. Claude Opus 4.7 0.081
  8. Claude Sonnet 5 0.066
  9. Claude Opus 4.6 0.066
  10. DeepSeek V4 Pro (High) (0813) 0.063

在 Arena — Agent 上查看全部 44 行

执行框架

换一个角度解读同一批数据:智能体是一个程序,而模型是它驱动的东西。这里只有一个数据源,因为它是找到的唯一一个把这对组合两半都写明的榜。

Artificial Analysis Coding Agents

Artificial Analysis Coding Agent Index 按执行框架 · 抓取于 2026-08-20

  1. Claude Code Claude Opus 5 0.667
  2. Codex GPT-5.6 Sol 0.666
  3. Grok Build Grok 4.5 0.644
  4. Kimi Code CLI Kimi K3 0.613
  5. Muse Code Muse Spark 1.2 0.605
  6. Opencode Gemini 3.7 Flash 0.571
  7. Antigravity SDK v0.1.8 Gemini 3.7 Flash 0.564
  8. Cursor CLI GPT-5.5 0.461
  9. Gemini CLI Gemini 3.1 Pro (high) 0.303