OnlySOTA

事實性

模型會不會說錯事實,以及不知道時會不會拒絕回答。兩項指標分開看:一項是準確率,一項是答錯卻很自信的比例,兩者並不同步變化。

按它在多少項基準裡進入前 10 排序,一樣多時看最好名次。每列保持各自的排名,不做平均。

模型 進入前 10 Artificial Analysis LLM Leaderboard AA-Omniscience Index Artificial Analysis LLM Leaderboard AA-Omniscience Non-Hallucination Rate
Gemini 4 Argon Google 2/2 #5 42.4 #5 84.9%
Claude Opus 5.5 Anthropic 1/2 #1 46.4 #95 41.4%
MiniCPM5 OpenBMB 1/2 #72 -0.800 #1 99.1%
GPT 6 Astra OpenAI 1/2 #2 43.7 #67 55.2%
G9v3 AI9Stars 1/2 #80 -4.367 #2 88.3%
Claude Fable 5.1 Anthropic 1/2 #3 43.5 #115 34.4%
G9v3 39A5B AI9Stars 1/2 #53 3.767 #3 87.0%
Claude Fable 5 Anthropic 1/2 #4 43.3 #109 36.4%
Command A+ Cohere 1/2 #78 -4.017 #4 85.8%
GPT 6.1 Sol OpenAI 1/2 #6 41.5 #76 50.6%
LFM2.5 Liquid AI 1/2 #100 -10.9 #6 84.0%
Claude Opus 5 Anthropic 1/2 #7 37.1 #97 40.5%
Grok 4.3 SpaceXAI 1/2 #27 18.0 #7 83.1%
Claude Sonnet 5.5 Anthropic 1/2 #8 32.3 #71 53.0%
Grok 4.20 SpaceXAI 1/2 #31 14.8 #8 82.6%
Grok 4.7 SpaceXAI 1/2 #9 32.0 #29 70.7%
Qwen 3.8 Alibaba 1/2 #89 -7.950 #9 81.9%
Gemini 3.1 Pro Google 1/2 #10 31.9 #80 49.1%
MiniMax M3 MiniMax 1/2 #58 1.350 #10 81.6%

「—」表示該榜沒有收錄這個模型,不是零分。尚未識別出具體模型的條目不在此處出現,但仍顯示在各自的原始榜單上。