OnlySOTA

代理式工作

軟體開發以外、取自真實職業的多步任務,比如試算表、文件、客戶服務流程,由模型藉助工具完成。

按它在多少項基準裡進入前 10 排序,一樣多時看最好名次。每列保持各自的排名,不做平均。

模型 進入前 10 Artificial Analysis LLM Leaderboard τ³-Banking Artificial Analysis LLM Leaderboard GDPval-AA Arena — Agent Overall
Claude Fable 5.1 Anthropic 3/3 #6 47.2% #3 62.9% #1 0.143
Qwen 3.8 Max Alibaba 2/3 #1 51.3% #8 58.6% #22 0.025
Claude Opus 5.5 Anthropic 2/3 — #1 68.3% #2 0.138
Claude Sonnet 5.5 Anthropic 2/3 — #2 67.0% #3 0.125
Muse Spark 1.3 Meta 2/3 #3 50.5% #7 59.2% #17 0.040
GLM 5.3 Z AI 2/3 #4 50.3% #9 57.6% #23 0.024
Claude Opus 5 Anthropic 2/3 #11 44.7% #4 61.2% #7 0.087
GLM 5.3 Flash Z AI 2/3 #7 47.2% #10 57.3% #31 -0.004
Grok 4.6 SpaceXAI 1/3 #2 50.7% #11 57.3% #25 0.013
GPT 6 Astra OpenAI 1/3 #13 43.1% #22 52.1% #4 0.123
Qwen 3.8 Alibaba 1/3 #5 48.0% #35 46.2% #36 -0.017
Grok 4.7 SpaceXAI 1/3 — #5 60.8% #15 0.040
GPT 6.1 Sol OpenAI 1/3 — #20 53.8% #5 0.112
MiMo V2.6 Pro Xiaomi 1/3 — #6 59.3% #20 0.033
GPT 6 Sol OpenAI 1/3 — #24 50.5% #6 0.097
Kimi K3 Kimi 1/3 #8 46.0% #23 51.8% #13 0.042
Claude Fable 5 Anthropic 1/3 #22 38.1% #15 55.6% #8 0.082
Gemini 3.8 Flash Google 1/3 #9 45.8% #33 46.8% #21 0.030
Gemini 4 Argon Google 1/3 — #13 56.3% #9 0.076
Qwen 3.8 Flash Next Alibaba 1/3 #10 45.4% #12 56.6% #33 -0.007
Claude Opus 4.8 Anthropic 1/3 #31 34.2% #28 47.8% #10 0.066

「—」表示該榜沒有收錄這個模型,不是零分。尚未識別出具體模型的條目不在此處出現,但仍顯示在各自的原始榜單上。