事实性
模型是否说了不符合事实的话,以及在它不知道的时候是否会拒答。两项指标分别衡量,变化趋势也可能不同:一项是准确率,一项是自信错答率。
按有多少个基准把该模型排进各自的前 10 名来排序,并列时看它的最佳名次。每一列保持各自的顺序,此处不做任何平均。
| 模型 | 进入前 10 | Artificial Analysis LLM Leaderboard AA-Omniscience Index | Artificial Analysis LLM Leaderboard AA-Omniscience Non-Hallucination Rate |
|---|---|---|---|
| | 2/2 | #4 30.5 | #8 76.0% |
| | 1/2 | #1 43.3 | #56 36.4% |
| | 1/2 | #30 -0.800 | #1 99.1% |
| | 1/2 | #2 37.1 | #48 40.5% |
| | 1/2 | #36 -4.367 | #2 88.3% |
| | 1/2 | #3 31.9 | #41 49.1% |
| | 1/2 | #20 3.767 | #3 87.0% |
| | 1/2 | #34 -4.017 | #4 85.8% |
| | 1/2 | #5 27.2 | #25 66.7% |
| | 1/2 | #12 16.7 | #5 83.1% |
| | 1/2 | #6 26.5 | #58 35.5% |
| | 1/2 | #25 1.350 | #6 81.6% |
| | 1/2 | #7 25.3 | #44 45.9% |
| | 1/2 | #37 -6.600 | #7 77.4% |
| | 1/2 | #8 22.1 | #45 44.4% |
| | 1/2 | #9 22.0 | #141 10.6% |
| | 1/2 | #31 -0.850 | #9 75.6% |
| | 1/2 | #10 20.8 | #53 38.2% |
| | 1/2 | #23 3.250 | #10 75.3% |
破折号表示该数据源未收录这个模型,而不是它得了零分。模型名录中没有条目的模型不在此处出现,因为它们无法跨数据源对齐——它们仍会显示在各自数据源的看板上,并带有标记。