综合偏好
在人们自带的提示词上,人更偏好哪个模型,按两两投票聚合。它衡量的是用户喜欢什么——这与能力相关,但并不是同一回事:长度、排版和语气同样会推动它,这也正是此处展示经过风格控制的评分的原因。
按有多少个基准把该模型排进各自的前 10 名来排序,并列时看它的最佳名次。每一列保持各自的顺序,此处不做任何平均。
| 模型 | 进入前 10 | Arena — Text Overall (style control) |
|---|---|---|
| | 1/1 | #1 1508 |
| | 1/1 | #2 1504 |
| | 1/1 | #3 1502 |
| | 1/1 | #4 1498 |
| | 1/1 | #5 1493 |
| | 1/1 | #6 1491 |
| | 1/1 | #7 1490 |
| | 1/1 | #8 1489 |
| | 1/1 | #9 1488 |
| | 1/1 | #10 1487 |
破折号表示该数据源未收录这个模型,而不是它得了零分。模型名录中没有条目的模型不在此处出现,因为它们无法跨数据源对齐——它们仍会显示在各自数据源的看板上,并带有标记。