OnlySOTA

Arena — Agent

Shown as Arena publishes it — their metrics, their models. A model name opens its page here; the arrow opens the original board.

Published by
Arena
Licence
not stated
Updates
continuous
Data as of
2026-10-02
Fetched
2026-10-02
Entries
51
Top 12 by Overall
  1. Claude Fable 5.1 0.143
  2. Claude Opus 5.5 0.138
  3. Claude Sonnet 5.5 0.125
  4. GPT 6 Astra 0.123
  5. GPT 6.1 Sol 0.112
  6. GPT 6 Sol 0.097
  7. Claude Opus 5 0.087
  8. Claude Fable 5 0.082
  9. Gemini 4 Argon 0.076
  10. Claude Opus 4.8 0.066
  11. GPT 5.6 Sol 0.065
  12. Claude Sonnet 5 0.044

51 scored

#Model
1Claude Fable 5.1agent · maxAnthropic0.1430.124–0.1620.1760.3220.0880.1240.005
2Claude Opus 5.5agent · highAnthropic0.1380.116–0.1600.1410.3120.1050.1280.005
3Claude Sonnet 5.5agent · maxAnthropic0.1250.094–0.1560.1390.2630.0690.1500.005
4GPT 6 Astraagent · maxOpenAI0.1230.100–0.1450.1320.3460.0780.0530.004
5GPT 6.1 Solagent · maxOpenAI0.1120.085–0.1400.1550.2550.1120.0350.005
6GPT 6 Solagent · maxOpenAI0.0970.073–0.1210.0710.2310.1120.0700.001
7Claude Opus 5agent · highAnthropic0.0870.073–0.1010.0760.1660.0660.1210.005
8Claude Fable 5agent · highAnthropic0.0820.070–0.0940.0610.1710.0890.0850.005
9Claude Opus 5agent · maxAnthropic0.0790.064–0.0940.0950.1200.0440.1330.005
10Gemini 4 Argonagent · highGoogle0.0760.056–0.0950.1540.2770.135-0.1890.001
11Claude Opus 4.8agent · highAnthropic0.0660.053–0.0800.0420.1470.0660.0750.002
12GPT 5.6 Solagent · xhighOpenAI0.0650.052–0.0770.0500.1950.0610.0140.002
13Claude Sonnet 5agent · highAnthropic0.0440.028–0.0600.0120.0860.0500.0690.003
14Kimi K3agent · maxKimi0.0420.036–0.0470.0760.0710.0140.0440.005
15GPT 5.5agent · xhighOpenAI0.0420.031–0.052-0.0090.0760.0420.0950.003
16Grok 4.7agent · xhighSpaceXAI0.0400.024–0.0560.0550.0730.0030.0680.003
17DeepSeek V4.1 Flashagent · maxDeepSeek0.0400.036–0.0450.0840.0230.0120.0780.004
18Muse Spark 1.3agent · maxMeta0.0400.034–0.0460.0500.0320.0550.0590.004
19Hy4agent · previewTencent0.0400.032–0.0470.0580.0680.0080.0630.001
20GLM 5.2agent · max · SiliconFlowZ AI0.0350.028–0.0420.0480.1000.0150.0070.005
21MiMo V2.6 ProunknownXiaomi0.0330.016–0.0490.0770.0550.0050.027-0.001
22Gemini 3.8 Flashagent · highGoogle0.0300.021–0.0380.0690.0520.031-0.0060.003
23Qwen 3.8 MaxunknownAlibaba0.0250.019–0.0310.0470.0320.0290.027-0.010
24GLM 5.3agent · maxZ AI0.0240.017–0.0300.0530.0530.009-0.0010.004
25GPT 6 Lunaagent · maxOpenAI0.0140.003–0.024-0.001-0.0170.0400.049-0.003
26Grok 4.6agent · xhighSpaceXAI0.0130.003–0.023-0.0060.0020.0070.0580.003
27Grok 4.5agentSpaceXAI0.0120.002–0.0220.013-0.0300.0200.0530.004
28DeepSeek V4 Prounknown · 0813 · highDeepSeek0.012-0.005–0.028-0.0170.0190.0090.0450.003
29GPT 5.4arena-harness · highOpenAI0.0110.001–0.020-0.0250.0030.0530.0200.002
30GPT 5.5agentOpenAI0.0100.001–0.020-0.0470.0380.0130.0450.003
31Step 5agent · previewStepFun0.005-0.010–0.0200.045-0.0490.0210.0030.005
32GPT 5.6 Terraagent · xhighOpenAI0.004-0.008–0.016-0.0390.0280.0240.0070.000
33GLM 5.3 FlashagentZ AI-0.004-0.009–0.0000.044-0.009-0.006-0.0540.004
34MiMo V2.6 FlashagentXiaomi-0.006-0.019–0.0070.056-0.008-0.003-0.036-0.037
35Qwen 3.8 Flash NextagentAlibaba-0.007-0.014–-0.0010.036-0.035-0.007-0.023-0.007
36GPT 5.6 Lunaagent · xhighOpenAI-0.012-0.018–-0.005-0.033-0.0380.0020.0080.003
37Gemini 3.7 Flashagent · highGoogle-0.015-0.022–-0.0070.012-0.031-0.011-0.0460.002
38Qwen 3.8agent · 27BAlibaba-0.017-0.023–-0.0110.010-0.025-0.005-0.060-0.002
39Muse Spark 1.2agent · xhighMeta-0.033-0.039–-0.026-0.054-0.121-0.0490.062-0.002
40Muse Spark 1.1agentMeta-0.049-0.053–-0.044-0.043-0.118-0.063-0.018-0.002
41Qwen 3.7 MaxagentAlibaba-0.051-0.061–-0.042-0.091-0.093-0.064-0.0090.000
42Hunyuan Hy3agentTencent-0.054-0.066–-0.042-0.112-0.0650.007-0.072-0.027
43MiniMax M3first-partyMiniMax-0.069-0.078–-0.060-0.137-0.142-0.0720.0070.000
44Qwen 3.7 PlusagentAlibaba-0.072-0.086–-0.057-0.093-0.112-0.082-0.062-0.008
45MiMo V2.5 ProagentXiaomi-0.075-0.084–-0.066-0.096-0.125-0.077-0.068-0.010
46Gemini 3.6 Flashagent · highGoogle-0.077-0.087–-0.066-0.057-0.085-0.073-0.1730.004
47Gemini 3.1 Proagent · previewGoogle-0.077-0.087–-0.067-0.099-0.015-0.046-0.225-0.001
48Inkling SmallunknownThinking Machines-0.103-0.117–-0.089-0.201-0.224-0.1410.054-0.004
49InklingagentThinking Machines-0.109-0.119–-0.098-0.207-0.226-0.1230.0110.002
50Mistral Medium 3.5agentMistral-0.124-0.139–-0.109-0.145-0.176-0.063-0.213-0.022
51Solar Pro 4agentUpstage-0.159-0.178–-0.141-0.205-0.233-0.090-0.252-0.014

What each column measures

Overall
Higher is better · Agentic work
Task outcome
Higher is better
Praise and complaint
Higher is better
Steering burden
Higher is better
Recovery after a failed command
Higher is better
Tool hallucination
Higher is better