OnlySOTA

综合偏好

真人在自己提的问题上更喜欢哪个模型的回答,由两两投票汇总。它反映用户偏好,和能力相关但不等同;回答长度、排版、语气也会影响结果,所以这里用排除了风格影响的分数。

按它在多少项基准里进入前 10 排序,一样多时看最好名次。每列保持各自的排名,不做平均。

模型 进入前 10 Arena — Text Overall (style control)
Gemini 4 Argon google 1/1 #1 1525
Claude Opus 4.6 anthropic 1/1 #2 1505
Claude Fable 5 anthropic 1/1 #3 1504
Claude Opus 5.5 anthropic 1/1 #4 1504
Claude Opus 4.7 anthropic 1/1 #5 1501
Claude Fable 5.1 anthropic 1/1 #6 1501
Gemini 3.8 Flash google 1/1 #7 1495
Muse Spark 1.3 meta 1/1 #8 1494
Muse Spark 1.2 meta 1/1 #9 1494
Muse Spark 1.1 meta 1/1 #10 1491

“—”表示该榜没收录这个模型,不是零分。还没识别出具体模型的条目不在这里出现,它们仍显示在各自的原始榜单上。