长上下文
需要一次读懂一大段输入的推理。标称的上下文窗口大不代表真能用好,这些基准测的就是能不能用好。
按它在多少项基准里进入前 10 排序,一样多时看最好名次。每列保持各自的排名,不做平均。
| 模型 | 进入前 10 | Artificial Analysis LLM Leaderboard AA-LCR |
|---|---|---|
| | 1/1 | #1 88.7% |
| | 1/1 | #2 88.3% |
| | 1/1 | #3 86.3% |
| | 1/1 | #4 85.3% |
| | 1/1 | #5 84.7% |
| | 1/1 | #6 84.3% |
| | 1/1 | #7 84.0% |
| | 1/1 | #8 84.0% |
| | 1/1 | #9 84.0% |
| | 1/1 | #10 84.0% |
“—”表示该榜没收录这个模型,不是零分。还没识别出具体模型的条目不在这里出现,它们仍显示在各自的原始榜单上。