OnlySOTA

推理與知識

有標準答案、難在推理而不在記憶的難題。這裡的分數普遍偏低是正常的:專門選的是還有提升空間的基準。

按它在多少項基準裡進入前 10 排序,一樣多時看最好名次。每列保持各自的排名,不做平均。

模型 進入前 10 Artificial Analysis LLM Leaderboard GPQA Diamond Artificial Analysis LLM Leaderboard Humanity's Last Exam Artificial Analysis LLM Leaderboard CritPt
GPT 6 Astra OpenAI 3/3 #1 96.3% #7 54.7% #3 31.7%
GPT 5.6 Sol OpenAI 3/3 #5 94.1% #9 49.5% #1 32.3%
Claude Fable 5.1 Anthropic 3/3 #8 93.7% #2 59.1% #6 31.1%
Claude Opus 5.5 Anthropic 2/3 — #1 61.4% #2 31.7%
GPT 6.1 Sol OpenAI 2/3 — #8 52.9% #4 31.7%
Claude Sonnet 5.5 Anthropic 2/3 — #5 55.0% #5 31.4%
Claude Opus 5 Anthropic 2/3 #9 93.7% #6 54.9% #11 29.1%
Gemini 3.8 Flash Google 1/3 #2 95.3% #15 47.8% #28 18.3%
Grok 4.6 SpaceXAI 1/3 #3 94.9% #22 44.1% #25 19.7%
Gemini 4 Argon Google 1/3 — #3 57.1% #14 27.1%
Gemini 3.7 Flash Google 1/3 #4 94.5% #14 47.9% #41 14.3%
Claude Fable 5 Anthropic 1/3 #17 92.6% #4 55.5% #12 28.6%
Gemini 3.1 Pro Google 1/3 #6 94.1% #16 47.0% #32 17.7%
Muse Spark 1.3 Meta 1/3 #7 94.1% #11 48.7% #16 26.0%
GPT 6 Sol OpenAI 1/3 — #13 47.9% #7 30.9%
GPT 5.5 Pro OpenAI 1/3 — — #8 30.6%
GPT 5.4 Pro OpenAI 1/3 — — #9 30.0%
GPT 5.5 OpenAI 1/3 #10 93.5% #20 45.8% #13 27.1%
GPT 5.6 Terra OpenAI 1/3 #18 92.5% #27 42.9% #10 30.0%
MiMo V2.6 Pro Xiaomi 1/3 — #10 49.4% #15 26.6%

「—」表示該榜沒有收錄這個模型,不是零分。尚未識別出具體模型的條目不在此處出現,但仍顯示在各自的原始榜單上。