长上下文
需要把一大段输入同时纳入视野的推理。标称的上下文窗口很大并不能证明这一点;这些基准衡量的是那个窗口到底能不能用。
按有多少个基准把该模型排进各自的前 10 名来排序,并列时看它的最佳名次。每一列保持各自的顺序,此处不做任何平均。
| 模型 | 进入前 10 | Artificial Analysis LLM Leaderboard AA-LCR |
|---|---|---|
| | 1/1 | #1 83.3% |
| | 1/1 | #2 82.7% |
| | 1/1 | #3 81.0% |
| | 1/1 | #4 80.3% |
| | 1/1 | #5 80.0% |
| | 1/1 | #6 79.7% |
| | 1/1 | #7 79.7% |
| | 1/1 | #8 79.0% |
| | 1/1 | #9 79.0% |
| | 1/1 | #10 78.7% |
破折号表示该数据源未收录这个模型,而不是它得了零分。模型名录中没有条目的模型不在此处出现,因为它们无法跨数据源对齐——它们仍会显示在各自数据源的看板上,并带有标记。