事實性
模型會不會說錯事實,以及不知道時會不會拒絕回答。兩項指標分開看:一項是準確率,一項是答錯卻很自信的比例,兩者並不同步變化。
按它在多少項基準裡進入前 10 排序,一樣多時看最好名次。每列保持各自的排名,不做平均。
| 模型 | 進入前 10 | Artificial Analysis LLM Leaderboard AA-Omniscience Index | Artificial Analysis LLM Leaderboard AA-Omniscience Non-Hallucination Rate |
|---|---|---|---|
| | 2/2 | #5 42.4 | #5 84.9% |
| | 1/2 | #1 46.4 | #95 41.4% |
| | 1/2 | #72 -0.800 | #1 99.1% |
| | 1/2 | #2 43.7 | #67 55.2% |
| | 1/2 | #80 -4.367 | #2 88.3% |
| | 1/2 | #3 43.5 | #115 34.4% |
| | 1/2 | #53 3.767 | #3 87.0% |
| | 1/2 | #4 43.3 | #109 36.4% |
| | 1/2 | #78 -4.017 | #4 85.8% |
| | 1/2 | #6 41.5 | #76 50.6% |
| | 1/2 | #100 -10.9 | #6 84.0% |
| | 1/2 | #7 37.1 | #97 40.5% |
| | 1/2 | #27 18.0 | #7 83.1% |
| | 1/2 | #8 32.3 | #71 53.0% |
| | 1/2 | #31 14.8 | #8 82.6% |
| | 1/2 | #9 32.0 | #29 70.7% |
| | 1/2 | #89 -7.950 | #9 81.9% |
| | 1/2 | #10 31.9 | #80 49.1% |
| | 1/2 | #58 1.350 | #10 81.6% |
「—」表示該榜沒有收錄這個模型,不是零分。尚未識別出具體模型的條目不在此處出現,但仍顯示在各自的原始榜單上。