長上下文
需要一次讀懂大段輸入的推理。標稱的上下文視窗大,不代表真能用好;這些基準測的正是能不能用好。
按它在多少項基準裡進入前 10 排序,一樣多時看最好名次。每列保持各自的排名,不做平均。
| 模型 | 進入前 10 | Artificial Analysis LLM Leaderboard AA-LCR |
|---|---|---|
| | 1/1 | #1 88.7% |
| | 1/1 | #2 88.3% |
| | 1/1 | #3 86.3% |
| | 1/1 | #4 85.3% |
| | 1/1 | #5 84.7% |
| | 1/1 | #6 84.3% |
| | 1/1 | #7 84.0% |
| | 1/1 | #8 84.0% |
| | 1/1 | #9 84.0% |
| | 1/1 | #10 84.0% |
「—」表示該榜沒有收錄這個模型,不是零分。尚未識別出具體模型的條目不在此處出現,但仍顯示在各自的原始榜單上。