OnlySOTA

事实性

模型是否说了不符合事实的话,以及在它不知道的时候是否会拒答。两项指标分别衡量,变化趋势也可能不同:一项是准确率,一项是自信错答率。

按有多少个基准把该模型排进各自的前 10 名来排序,并列时看它的最佳名次。每一列保持各自的顺序,此处不做任何平均。

模型 进入前 10 Artificial Analysis LLM Leaderboard AA-Omniscience Index Artificial Analysis LLM Leaderboard AA-Omniscience Non-Hallucination Rate
Grok 4.6 xai 2/2 #4 30.5 #8 76.0%
Claude Fable 5 (Opus 4.8 fallback) anthropic 1/2 #1 43.3 #56 36.4%
MiniCPM5-1B openbmb 1/2 #30 -0.800 #1 99.1%
Claude Opus 5 anthropic 1/2 #2 37.1 #48 40.5%
G9v3-3B ai9star 1/2 #36 -4.367 #2 88.3%
Gemini 3.1 Pro Preview google 1/2 #3 31.9 #41 49.1%
G9v3-39A5B ai9star 1/2 #20 3.767 #3 87.0%
Command A+ cohere 1/2 #34 -4.017 #4 85.8%
Muse Spark 1.2 meta 1/2 #5 27.2 #25 66.7%
Grok 4.3 xai 1/2 #12 16.7 #5 83.1%
Gemini 3.7 Flash google 1/2 #6 26.5 #58 35.5%
MiniMax-M3 minimax 1/2 #25 1.350 #6 81.6%
Grok 4.5 xai 1/2 #7 25.3 #44 45.9%
K-EXAONE 2.0 0803 lg 1/2 #37 -6.600 #7 77.4%
Gemini 3.6 Flash google 1/2 #8 22.1 #45 44.4%
GPT-5.6 Sol openai 1/2 #9 22.0 #141 10.6%
Solar Pro 4 upstage 1/2 #31 -0.850 #9 75.6%
Gemini 3.5 Flash google 1/2 #10 20.8 #53 38.2%
MiMo-V2.5-Pro xiaomi 1/2 #23 3.250 #10 75.3%

破折号表示该数据源未收录这个模型,而不是它得了零分。模型名录中没有条目的模型不在此处出现,因为它们无法跨数据源对齐——它们仍会显示在各自数据源的看板上,并带有标记。