OnlySOTA

编程

按规格写代码和改代码,在没有智能体循环的条件下衡量。与智能体编程不同:这些基准直接对模型的输出打分,而不是对“模型 + 执行框架”这个系统打分。

按有多少个基准把该模型排进各自的前 10 名来排序,并列时看它的最佳名次。每一列保持各自的顺序,此处不做任何平均。

模型 进入前 10 Artificial Analysis LLM Leaderboard SciCode Artificial Analysis LLM Leaderboard Coding Index Arena — Code Overall
Claude Fable 5 (Opus 4.8 fallback) anthropic 3/3 #1 60.2% #5 76.5 #4 1626
GPT-5.6 Sol openai 3/3 #5 56.9% #1 78.3 #5 1619
Claude Opus 5 anthropic 3/3 #8 55.7% #2 78.0 #1 1691
Kimi K3 kimi 3/3 #3 58.7% #6 76.2 #2 1674
Grok 4.6 xai 3/3 #9 54.6% #3 76.8 #3 1629
Gemini 3.7 Flash google 3/3 #4 57.9% #7 76.1 #7 1587
GLM-5.3 zai 3/3 #6 56.5% #8 74.8 #6 1599
Muse Spark 1.2 meta 2/3 #7 56.4% #10 72.2 #16 1534
Grok 4.5 xai 2/3 #10 54.1% #9 72.4 #11 1556
Gemini 3.1 Pro Preview google 1/3 #2 58.9% #18 68.8 #31 1446
GPT-5.6 Terra openai 1/3 #11 53.9% #4 76.7 #18 1520
GLM-5.2 zai 1/3 #19 50.5% #19 68.8 #8 1582
Claude Opus 4.8 anthropic 1/3 #9 1563
Claude Opus 4.7 anthropic 1/3 #10 1558

破折号表示该数据源未收录这个模型,而不是它得了零分。模型名录中没有条目的模型不在此处出现,因为它们无法跨数据源对齐——它们仍会显示在各自数据源的看板上,并带有标记。