OnlySOTA

程式設計

按要求寫程式碼、改程式碼,不藉助代理迴圈,直接給模型的輸出打分。它與「代理式程式設計」不同,後者評的是「模型 + 框架」的整體。

按它在多少項基準裡進入前 10 排序,一樣多時看最好名次。每列保持各自的排名,不做平均。

模型 進入前 10 Artificial Analysis LLM Leaderboard SciCode Arena — Code Overall
Claude Opus 5.5 Anthropic 2/2 #1 66.9% #1 1815
Claude Fable 5.1 Anthropic 2/2 #2 63.1% #5 1749
Gemini 4 Argon Google 2/2 #3 61.8% #8 1680
Claude Sonnet 5.5 Anthropic 2/2 #5 61.0% #3 1786
Kimi K3 Kimi 2/2 #9 59.5% #10 1658
GPT 6 Astra OpenAI 1/2 #19 56.5% #2 1788
Claude Fable 5 Anthropic 1/2 #4 61.0% #16 1625
GPT 6.1 Sol OpenAI 1/2 #23 55.8% #4 1758
MiMo V2.6 Pro Xiaomi 1/2 #6 60.9% —
Claude Opus 5 Anthropic 1/2 #21 56.4% #6 1695
Gemini 3.7 Flash Google 1/2 #7 59.8% #23 1592
GPT 6 Sol OpenAI 1/2 #16 57.6% #7 1689
Muse Spark 1.3 Meta 1/2 #8 59.7% #11 1657
Qwen 3.8 Max Alibaba 1/2 #31 54.1% #9 1671
GLM 5.3 Z AI 1/2 #10 59.0% #17 1623

「—」表示該榜沒有收錄這個模型,不是零分。尚未識別出具體模型的條目不在此處出現,但仍顯示在各自的原始榜單上。