OnlySOTA

多模态

光靠文字回答不了、必须看懂图片才能答对的问题。目前只有看图推理这一类,因为各榜目前只测这一项。

按它在多少项基准里进入前 10 排序,一样多时看最好名次。每列保持各自的排名,不做平均。

模型 进入前 10 Artificial Analysis LLM Leaderboard MMMU-Pro Arena — Vision Overall (style control)
GPT 6.1 Sol openai 2/2 #3 86.0% #8 1291
Gemini 3.8 Flash google 2/2 #4 85.6% #9 1290
Gemini 3.7 Flash google 2/2 #5 85.5% #5 1296
Claude Opus 5.5 anthropic 1/2 #1 87.7% —
Claude Fable 5 anthropic 1/2 — #1 1309
GPT 6 Astra openai 1/2 #2 86.9% #18 1284
Qwen 3.8 Max alibaba 1/2 #11 82.8% #2 1301
Claude Opus 4.6 anthropic 1/2 #44 75.4% #3 1299
Claude Opus 4.7 anthropic 1/2 #27 78.8% #4 1298
Claude Opus 5 anthropic 1/2 #6 84.7% #12 1289
Muse Spark meta 1/2 #17 80.5% #6 1294
Gemini 3.5 Flash google 1/2 #7 84.3% #17 1284
Muse Spark 1.2 meta 1/2 — #7 1293
GPT 5.6 Sol openai 1/2 #8 83.4% #16 1285
Gemini 3.6 Flash google 1/2 #9 83.2% #21 1280
GPT 6 Sol openai 1/2 #10 82.9% —
Muse Spark 1.3 meta 1/2 #13 82.0% #10 1290

“—”表示该榜没收录这个模型,不是零分。还没识别出具体模型的条目不在这里出现,它们仍显示在各自的原始榜单上。