OnlySOTA

多模態

只靠文字無法回答、必須看懂圖片才能答對的問題。目前只涵蓋看圖推理,因為各榜只測了這一類。

按它在多少項基準裡進入前 10 排序,一樣多時看最好名次。每列保持各自的排名,不做平均。

模型 進入前 10 Artificial Analysis LLM Leaderboard MMMU-Pro Arena — Vision Overall (style control)
GPT 6.1 Sol OpenAI 2/2 #3 86.0% #8 1291
Gemini 3.8 Flash Google 2/2 #4 85.6% #9 1290
Gemini 3.7 Flash Google 2/2 #5 85.5% #5 1296
Claude Opus 5.5 Anthropic 1/2 #1 87.7% —
Claude Fable 5 Anthropic 1/2 — #1 1309
GPT 6 Astra OpenAI 1/2 #2 86.9% #18 1284
Qwen 3.8 Max Alibaba 1/2 #11 82.8% #2 1301
Claude Opus 4.6 Anthropic 1/2 #45 75.4% #3 1299
Claude Opus 4.7 Anthropic 1/2 #27 78.8% #4 1298
Claude Opus 5 Anthropic 1/2 #6 84.7% #12 1289
Muse Spark Meta 1/2 #17 80.5% #6 1294
Gemini 3.5 Flash Google 1/2 #7 84.3% #17 1284
Muse Spark 1.2 Meta 1/2 — #7 1293
GPT 5.6 Sol OpenAI 1/2 #8 83.4% #16 1285
Gemini 3.6 Flash Google 1/2 #9 83.2% #21 1280
GPT 6 Sol OpenAI 1/2 #10 82.9% —
Muse Spark 1.3 Meta 1/2 #13 82.0% #10 1290

「—」表示該榜沒有收錄這個模型,不是零分。尚未識別出具體模型的條目不在此處出現,但仍顯示在各自的原始榜單上。