多模态
仅凭文本无法回答的问题。目前限于视觉推理,因为这就是这些数据源所衡量的范围。
按有多少个基准把该模型排进各自的前 10 名来排序,并列时看它的最佳名次。每一列保持各自的顺序,此处不做任何平均。
| 模型 | 进入前 10 | Artificial Analysis LLM Leaderboard MMMU-Pro | Arena — Vision Overall (style control) |
|---|---|---|---|
| | 2/2 | #2 84.7% | #6 1292 |
| | 2/2 | #3 83.9% | #8 1286 |
| | 2/2 | #5 83.2% | #10 1285 |
| | 1/2 | #1 85.5% | — |
| | 1/2 | — | #1 1312 |
| | 1/2 | — | #2 1301 |
| | 1/2 | — | #3 1299 |
| | 1/2 | #4 83.4% | #14 1281 |
| | 1/2 | — | #4 1294 |
| | 1/2 | — | #5 1292 |
| | 1/2 | #6 82.4% | #16 1277 |
| | 1/2 | #7 82.3% | — |
| | 1/2 | — | #7 1289 |
| | 1/2 | #8 80.7% | #21 1266 |
| | 1/2 | #9 80.5% | — |
| | 1/2 | — | #9 1285 |
| | 1/2 | #10 80.5% | #22 1265 |
破折号表示该数据源未收录这个模型,而不是它得了零分。模型名录中没有条目的模型不在此处出现,因为它们无法跨数据源对齐——它们仍会显示在各自数据源的看板上,并带有标记。