OnlySOTA

指令遵循

模型是否遵守對輸出的明確要求,比如格式、長度、必須包含或不能出現的內容,與內容本身好壞無關。

按它在多少項基準裡進入前 10 排序,一樣多時看最好名次。每列保持各自的排名,不做平均。

模型 進入前 10 Artificial Analysis LLM Leaderboard IFBench
Grok 4.3 SpaceXAI 1/1 #1 83.3%
Grok 4.20 SpaceXAI 1/1 #2 82.9%
MiniMax M3 MiniMax 1/1 #3 82.9%
Nemotron 3 Ultra NVIDIA 1/1 #4 81.4%
Qwen 3.7 Max Alibaba 1/1 #5 80.5%
Nemotron Cascade 2 NVIDIA 1/1 #6 80.4%
MiMo V2.5 Pro Xiaomi 1/1 #7 79.9%
Nova 2.0 Pro Amazon 1/1 #8 79.6%
DeepSeek V4 Flash DeepSeek 1/1 #9 79.2%
Qwen 3.5 Alibaba 1/1 #10 78.8%

「—」表示該榜沒有收錄這個模型,不是零分。尚未識別出具體模型的條目不在此處出現,但仍顯示在各自的原始榜單上。