OnlySOTA

多模态

仅凭文本无法回答的问题。目前限于视觉推理,因为这就是这些数据源所衡量的范围。

按有多少个基准把该模型排进各自的前 10 名来排序,并列时看它的最佳名次。每一列保持各自的顺序,此处不做任何平均。

模型 进入前 10 Artificial Analysis LLM Leaderboard MMMU-Pro Arena — Vision Overall (style control)
Claude Opus 5 anthropic 2/2 #2 84.7% #6 1292
Gemini 3.5 Flash google 2/2 #3 83.9% #8 1286
Gemini 3.6 Flash google 2/2 #5 83.2% #10 1285
Gemini 3.7 Flash google 1/2 #1 85.5%
Claude Fable 5 (Opus 4.8 fallback) anthropic 1/2 #1 1312
Claude Opus 4.7 anthropic 1/2 #2 1301
Claude Opus 4.6 anthropic 1/2 #3 1299
GPT-5.6 Sol openai 1/2 #4 83.4% #14 1281
Muse Spark meta 1/2 #4 1294
Muse Spark 1.2 meta 1/2 #5 1292
Gemini 3.1 Pro Preview google 1/2 #6 82.4% #16 1277
Qwen3.8 Max alibaba 1/2 #7 82.3%
Gemini 3 Pro Preview google 1/2 #7 1289
GPT-5.6 Terra openai 1/2 #8 80.7% #21 1266
Kimi K3 kimi 1/2 #9 80.5%
Claude Opus 4.8 anthropic 1/2 #9 1285
Qwen3.7 Plus alibaba 1/2 #10 80.5% #22 1265

破折号表示该数据源未收录这个模型,而不是它得了零分。模型名录中没有条目的模型不在此处出现,因为它们无法跨数据源对齐——它们仍会显示在各自数据源的看板上,并带有标记。