OnlySOTA

Artificial Analysis Coding Agents

As Artificial Analysis publishes it — their metrics, their models. Follow a model name to its page upstream.

Published by
Artificial Analysis
Licence
not stated
Updates
continuous
Fetched
2026-08-20
Entries
59 · 5 unmatched
Top 12 by Artificial Analysis Coding Agent Index, one row per model
  1. Claude Opus 5 0.667
  2. GPT-5.6 Sol 0.666
  3. Fable 5 (max) (with fallback) Unknown developerUD 0.658
  4. Grok 4.5 0.644
  5. GPT-5.6 Terra 0.623
  6. GPT-5.5 0.615
  7. Kimi K3 0.613
  8. Claude Opus 4.8 0.606
  9. Muse Spark 1.2 0.605
  10. Qwen3.8 Max 0.598
  11. GPT-5.6 Luna 0.587
  12. Gemini 3.7 Flash 0.571

59 scored

#Model
1Claude Opus 5Claude Code · xhighanthropic0.66760.5%54.8%84.9%$8.231418.81s
2GPT-5.6 SolCodex · maxopenai0.66668.7%43.3%87.7%$7.08610.08s
3Unknown developerUDFable 5 (max) (with fallback)Claude CodeUnmatched0.65866.1%48.9%82.5%$11.701403.71s
4Claude Opus 5Claude Code · maxanthropic0.65563.1%48.9%84.5%$8.951423.99s
5GPT-5.6 SolCodex · xhighopenai0.65167.0%42.2%86.1%$5.24443.62s
6Grok 4.5Grok Build · highxai0.64459.9%48.1%85.3%$2.59988.66s
7GPT-5.6 SolCodex · highopenai0.64164.9%44.9%82.5%$4.14379.29s
8Claude Opus 5Claude Code · highanthropic0.63460.8%49.2%80.2%$3.80802.32s
9GPT-5.6 TerraCodex · maxopenai0.62367.0%35.8%84.1%$2.21502.38s
10Claude Opus 5Claude Code · mediumanthropic0.61962.8%44.4%78.6%$3.14731.49s
11GPT-5.5Codex · xhighopenai0.61564.3%36.0%84.1%$5.07604.97s
12Kimi K3Kimi Code CLIkimi0.61363.7%36.6%83.7%$3.181427.73s
13Claude Opus 4.8Claude Code · maxanthropic0.60655.8%46.8%79.4%$7.701387.44s
14GPT-5.6 SolCodex · mediumopenai0.60664.0%40.1%77.8%$2.99310.18s
15Muse Spark 1.2Muse Code · xhighmeta0.60558.1%44.9%78.6%$2.332519.42s
16Qwen3.8 MaxClaude Codealibaba0.59851.9%48.2%79.4%$3.301791.91s
17GPT-5.6 LunaCodex · maxopenai0.58763.4%32.8%79.8%$0.31479.74s
18Claude Opus 4.8Claude Code · xhighanthropic0.58551.3%42.7%81.3%$5.671062.37s
19GPT-5.6 TerraCodex · xhighopenai0.57158.4%32.3%80.6%$1.52412.95s
20Gemini 3.7 FlashOpencode · highgoogle0.57157.2%30.6%83.3%$1.26507.93s
21Claude Opus 5Claude Code · lowanthropic0.56856.9%39.2%74.2%$2.18569.29s
22Muse Spark 1.2Opencode · xhighmeta0.56852.8%44.1%73.4%$1.911068.84s
23Claude Opus 4.8Claude Code · highanthropic0.56751.6%38.7%79.8%$3.74746.28s
24Gemini 3.7 FlashAntigravity SDK v0.1.8 · highgoogle0.56456.0%27.2%86.1%$1.39380.37s
25GPT-5.6 TerraCodex · highopenai0.55860.5%30.9%76.0%$1.27370.78s
26DeepSeek V4 FlashCodex · maxdeepseek0.55542.8%38.7%84.9%$0.07877.44s
27GPT-5.6 LunaCodex · xhighopenai0.54756.6%31.2%76.2%$0.25395.38s
28GPT-5.5Codex · mediumopenai0.54456.6%30.6%75.8%$2.75384.13s
29GPT-5.6 SolCodex · lowopenai0.53653.4%34.4%73.0%$1.72221.85s
30Claude Opus 4.8Claude Code · mediumanthropic0.53649.3%36.0%75.4%$3.26742.54s
31Muse Spark 1.1Opencode · xhighmeta0.53554.3%33.3%73.0%$1.43755.21s
32GPT-5.6 LunaCodex · highopenai0.51453.4%29.0%71.8%$0.19339.05s
33Claude Opus 4.7Claude Code · maxanthropic0.50340.1%37.1%73.8%$5.63939.75s
34Claude Opus 4.7Opencode · mediumanthropic0.50339.5%36.0%75.4%$2.93731.68s
35GPT-5.6 TerraCodex · mediumopenai0.47845.7%28.2%69.4%$0.72256.39s
36Claude Opus 4.8Claude Code · lowanthropic0.47441.0%28.2%73.0%$2.15505.67s
37Claude Opus 4.6Claude Code · mediumanthropic0.46522.3%70.6%$1.28479.63s
38GPT-5.5Cursor CLI · mediumopenai0.46137.2%27.7%73.4%$2.01398.80s
39Gemini 3.6 FlashOpencode · highgoogle0.45641.3%21.8%73.8%$2.08625.26s
40Claude Opus 4.7Cursor CLI · mediumanthropic0.45431.6%33.9%70.6%$2.68816.85s
41GPT-5.6 SolCodex · offopenai0.43435.4%34.1%60.7%$1.40206.26s
42GLM-5.2Claude Codezai0.43228.6%29.0%71.9%$6.511505.09s
43GPT-5.6 LunaCodex · mediumopenai0.42436.6%27.2%63.5%$0.09202.33s
44Claude Opus 4.7Claude Code · mediumanthropic0.40527.4%22.6%71.4%$1.68379.61s
45GPT-5.4Codex · mediumopenai0.39125.0%22.3%69.8%$2.42425.07s
46Unknown developerUDComposer 2.5Cursor CLIUnmatched0.38215.9%31.2%67.5%$0.08572.81s
47Unknown developerUDComposer 2.5 FastCursor CLIUnmatched0.38215.9%31.2%67.5%$0.55406.08s
48Claude Sonnet 4.6Claude Code · mediumanthropic0.37628.9%19.6%64.3%$2.01807.42s
49GPT-5.4Cursor CLI · mediumopenai0.37116.7%28.2%66.3%$1.55485.68s
50GPT-5.6 TerraCodex · lowopenai0.36729.8%22.8%57.5%$0.39167.00s
51GLM-5.1Claude Codezai0.36118.6%24.7%65.1%$4.331166.25s
52Qwen3.7 PlusClaude Code · onalibaba0.36019.2%23.7%65.1%$6.23633.82s
53Kimi K2.6Claude Codekimi0.32616.5%15.9%65.5%$1.192460.81s
54DeepSeek V4 ProClaude Code · highdeepseek0.3148.6%19.9%65.9%$0.271072.49s
55Unknown developerUDGemini 3.1 Pro (high)Gemini CLI · highUnmatched0.30314.2%8.6%68.3%$2.00649.43s
56Unknown developerUDComposer 2Cursor CLIUnmatched0.2750.0%17.7%64.7%$0.04514.04s
57GPT-5.6 LunaCodex · lowopenai0.25110.3%15.3%49.6%$0.04115.41s
58GPT-5.6 TerraCodex · offopenai0.23713.3%18.5%39.3%$0.30107.57s
59GPT-5.6 LunaCodex · offopenai0.2046.5%17.5%37.3%$0.07149.67s

What the columns measure

Artificial Analysis Coding Agent Index
Higher is better · Agentic coding
DeepSWE
Higher is better
SWE-Atlas-QnA
Higher is better
Terminal-Bench v2
Higher is better · Agentic coding
Cost
Lower is better · Cost
Execution Time
Lower is better