事实性
模型会不会说错事实,以及不知道时会不会拒绝回答。两个指标分开看:一个是准确率,一个是答错却很自信的比例。
按它在多少项基准里进入前 10 排序,一样多时看最好名次。每列保持各自的排名,不做平均。
| 模型 | 进入前 10 | Artificial Analysis LLM Leaderboard AA-Omniscience Index | Artificial Analysis LLM Leaderboard AA-Omniscience Non-Hallucination Rate |
|---|---|---|---|
| | 2/2 | #5 42.4 | #5 84.9% |
| | 1/2 | #1 46.4 | #93 41.4% |
| | 1/2 | #71 -0.800 | #1 99.1% |
| | 1/2 | #2 43.7 | #65 55.2% |
| | 1/2 | #79 -4.367 | #2 88.3% |
| | 1/2 | #3 43.5 | #113 34.4% |
| | 1/2 | #53 3.767 | #3 87.0% |
| | 1/2 | #4 43.3 | #107 36.4% |
| | 1/2 | #77 -4.017 | #4 85.8% |
| | 1/2 | #6 41.5 | #74 50.6% |
| | 1/2 | #98 -10.9 | #6 84.0% |
| | 1/2 | #7 37.1 | #95 40.5% |
| | 1/2 | #27 18.0 | #7 83.1% |
| | 1/2 | #8 32.3 | #69 53.0% |
| | 1/2 | #31 14.8 | #8 82.6% |
| | 1/2 | #9 32.0 | #29 70.7% |
| | 1/2 | #87 -7.950 | #9 81.9% |
| | 1/2 | #10 31.9 | #78 49.1% |
| | 1/2 | #57 1.350 | #10 81.6% |
“—”表示该榜没收录这个模型,不是零分。还没识别出具体模型的条目不在这里出现,它们仍显示在各自的原始榜单上。