OnlySOTA

指令遵循

模型是否遵守对输出的明确要求,比如格式、长度、必须包含或不能出现的内容,与内容本身好坏无关。

按它在多少项基准里进入前 10 排序,一样多时看最好名次。每列保持各自的排名,不做平均。

模型 进入前 10 Artificial Analysis LLM Leaderboard IFBench
Grok 4.3 xai 1/1 #1 83.3%
Grok 4.20 xai 1/1 #2 82.9%
MiniMax M3 minimax 1/1 #3 82.9%
Nemotron 3 Ultra nvidia 1/1 #4 81.4%
Qwen 3.7 Max alibaba 1/1 #5 80.5%
Nemotron Cascade 2 nvidia 1/1 #6 80.4%
MiMo V2.5 Pro xiaomi 1/1 #7 79.9%
Nova 2.0 Pro aws 1/1 #8 79.6%
DeepSeek V4 Flash deepseek 1/1 #9 79.2%
Qwen 3.5 alibaba 1/1 #10 78.8%

“—”表示该榜没收录这个模型,不是零分。还没识别出具体模型的条目不在这里出现,它们仍显示在各自的原始榜单上。