OnlySOTA

长上下文

需要把一大段输入同时纳入视野的推理。标称的上下文窗口很大并不能证明这一点;这些基准衡量的是那个窗口到底能不能用。

按有多少个基准把该模型排进各自的前 10 名来排序,并列时看它的最佳名次。每一列保持各自的顺序,此处不做任何平均。

模型 进入前 10 Artificial Analysis LLM Leaderboard AA-LCR
Muse Spark 1.2 meta 1/1 #1 83.3%
Kimi K3 kimi 1/1 #2 82.7%
Gemini 3.7 Flash google 1/1 #3 81.0%
MiniMax-M3 minimax 1/1 #4 80.3%
Muse Glimmer meta 1/1 #5 80.0%
GPT-5.6 Terra openai 1/1 #6 79.7%
Gemini 3.5 Flash google 1/1 #7 79.7%
Gemini 3.1 Pro Preview google 1/1 #8 79.0%
Gemini 3.6 Flash google 1/1 #9 79.0%
Claude Opus 5 anthropic 1/1 #10 78.7%

破折号表示该数据源未收录这个模型,而不是它得了零分。模型名录中没有条目的模型不在此处出现,因为它们无法跨数据源对齐——它们仍会显示在各自数据源的看板上,并带有标记。