OnlySOTA

長上下文

需要一次讀懂大段輸入的推理。標稱的上下文視窗大,不代表真能用好;這些基準測的正是能不能用好。

按它在多少項基準裡進入前 10 排序,一樣多時看最好名次。每列保持各自的排名,不做平均。

模型 進入前 10 Artificial Analysis LLM Leaderboard AA-LCR
Kimi K3 Kimi 1/1 #1 88.7%
Step 5 StepFun 1/1 #2 88.3%
MiMo V2.6 Pro Xiaomi 1/1 #3 86.3%
Claude Fable 5.1 Anthropic 1/1 #4 85.3%
Claude Opus 5.5 Anthropic 1/1 #5 84.7%
GPT 5.5 OpenAI 1/1 #6 84.3%
DeepSeek V4.1 Flash DeepSeek 1/1 #7 84.0%
GPT 5.6 Sol OpenAI 1/1 #8 84.0%
GPT 6.1 Sol OpenAI 1/1 #9 84.0%
Gemini 3.8 Flash Google 1/1 #10 84.0%

「—」表示該榜沒有收錄這個模型,不是零分。尚未識別出具體模型的條目不在此處出現,但仍顯示在各自的原始榜單上。