OnlySOTA

代理式程式設計

藉助工具迴圈解決真實程式碼儲存庫和終端機任務。這裡每個分數衡量的都是「模型 + 框架」的整體,所以同一個模型可能佔兩行,分別對應不同框架,這不是重複。

按它在多少項基準裡進入前 10 排序,一樣多時看最好名次。每列保持各自的排名,不做平均。

模型 進入前 10 Artificial Analysis LLM Leaderboard Terminal-Bench 2.1 Artificial Analysis Coding Agents Artificial Analysis Coding Agent Index Artificial Analysis Coding Agents Terminal-Bench v4 HarnessTax — SWE-bench Lite SWE-bench Lite HarnessTax — Terminal-Bench 2.0 Terminal-Bench 2.0
GPT 5.6 Sol OpenAI 5/5 #3 89.5% #10 0.546 #10 37.4% #3 77.8% #1 83.3%
Claude Fable 5.1 Anthropic 3/5 #1 91.4% #5 0.622 #3 57.6% — —
GPT 6 Astra OpenAI 3/5 #2 89.9% #6 0.616 #5 55.6% — —
Claude Opus 5 Anthropic 3/5 #4 89.1% #7 0.597 #7 54.5% — —
Claude Fable 5 Anthropic 2/5 #13 84.6% — — #1 97.8% #3 75.6%
Claude Sonnet 5.5 Anthropic 2/5 — #1 0.684 #1 66.2% — —
Claude Opus 4.8 Anthropic 2/5 #14 84.6% — — #2 88.9% #5 72.2%
GPT 5.6 Luna OpenAI 2/5 #20 80.9% #16 0.432 #17 14.6% #7 55.6% #2 76.7%
Claude Opus 5.5 Anthropic 2/5 — #2 0.660 #2 63.1% — —
Gemini 4 Argon Google 2/5 — #3 0.638 #4 56.1% — —
Kimi K3 Kimi 2/5 #12 85.0% #13 0.519 #13 21.2% #4 76.7% #4 73.3%
GPT 6.1 Sol OpenAI 2/5 — #4 0.629 #6 54.5% — —
Claude Sonnet 4.6 Anthropic 2/5 #36 71.2% — — #5 68.9% #6 65.6%
Claude Haiku 4.5 Anthropic 2/5 #77 44.2% — — #6 60.0% #7 47.8%
GPT 6 Sol OpenAI 2/5 — #8 0.567 #8 43.4% — —
Qwen 3.8 Max Alibaba 1/5 #5 88.8% #15 0.433 #15 16.7% — —
Grok 4.6 SpaceXAI 1/5 #6 88.4% #14 0.470 #14 17.7% — —
GPT 5.6 Terra OpenAI 1/5 #7 88.0% — — — —
Gemini 3.8 Flash Google 1/5 #8 87.6% #18 0.419 #18 14.6% — —
Qwen 3.8 Flash Next Alibaba 1/5 #9 86.1% — — — —
GLM 5.3 Z AI 1/5 #17 83.9% #12 0.536 #9 39.9% — —
Grok 4.7 SpaceXAI 1/5 — #9 0.563 #11 33.3% — —
Gemini 3.7 Flash Google 1/5 #10 85.8% — — — —

「—」表示該榜沒有收錄這個模型,不是零分。尚未識別出具體模型的條目不在此處出現,但仍顯示在各自的原始榜單上。