指令遵循
模型是否服从对其输出的明确约束——格式、长度、必须包含、必须排除——与内容本身好不好无关。
按有多少个基准把该模型排进各自的前 10 名来排序,并列时看它的最佳名次。每一列保持各自的顺序,此处不做任何平均。
| 模型 | 进入前 10 | Artificial Analysis LLM Leaderboard IFBench |
|---|---|---|
| | 1/1 | #1 83.3% |
| | 1/1 | #2 82.9% |
| | 1/1 | #3 81.4% |
| | 1/1 | #4 80.4% |
| | 1/1 | #5 79.9% |
| | 1/1 | #6 79.6% |
| | 1/1 | #7 78.8% |
| | 1/1 | #8 78.0% |
| | 1/1 | #9 77.1% |
| | 1/1 | #10 76.5% |
破折号表示该数据源未收录这个模型,而不是它得了零分。模型名录中没有条目的模型不在此处出现,因为它们无法跨数据源对齐——它们仍会显示在各自数据源的看板上,并带有标记。