OnlySOTA

长上下文

需要一次读懂一大段输入的推理。标称的上下文窗口大不代表真能用好,这些基准测的就是能不能用好。

按它在多少项基准里进入前 10 排序,一样多时看最好名次。每列保持各自的排名,不做平均。

模型 进入前 10 Artificial Analysis LLM Leaderboard AA-LCR
Kimi K3 kimi 1/1 #1 88.7%
Step 5 stepfun 1/1 #2 88.3%
MiMo V2.6 Pro xiaomi 1/1 #3 86.3%
Claude Fable 5.1 anthropic 1/1 #4 85.3%
Claude Opus 5.5 anthropic 1/1 #5 84.7%
GPT 5.5 openai 1/1 #6 84.3%
DeepSeek V4.1 Flash deepseek 1/1 #7 84.0%
GPT 5.6 Sol openai 1/1 #8 84.0%
GPT 6.1 Sol openai 1/1 #9 84.0%
Gemini 3.8 Flash google 1/1 #10 84.0%

“—”表示该榜没收录这个模型,不是零分。还没识别出具体模型的条目不在这里出现,它们仍显示在各自的原始榜单上。