OnlySOTA

综合偏好

在人们自带的提示词上,人更偏好哪个模型,按两两投票聚合。它衡量的是用户喜欢什么——这与能力相关,但并不是同一回事:长度、排版和语气同样会推动它,这也正是此处展示经过风格控制的评分的原因。

按有多少个基准把该模型排进各自的前 10 名来排序,并列时看它的最佳名次。每一列保持各自的顺序,此处不做任何平均。

模型 进入前 10 Arena — Text Overall (style control)
Claude Fable 5 (Opus 4.8 fallback) anthropic 1/1 #1 1508
Claude Opus 4.6 anthropic 1/1 #2 1504
Claude Opus 4.7 anthropic 1/1 #3 1502
Muse Spark 1.2 meta 1/1 #4 1498
Claude Opus 5 anthropic 1/1 #5 1493
Muse Spark 1.1 meta 1/1 #6 1491
Gemini 3.7 Flash google 1/1 #7 1490
Kimi K3 kimi 1/1 #8 1489
Muse Spark meta 1/1 #9 1488
GLM-5.3 zai 1/1 #10 1487

破折号表示该数据源未收录这个模型,而不是它得了零分。模型名录中没有条目的模型不在此处出现,因为它们无法跨数据源对齐——它们仍会显示在各自数据源的看板上,并带有标记。