OnlySOTA

指令遵循

模型是否服从对其输出的明确约束——格式、长度、必须包含、必须排除——与内容本身好不好无关。

按有多少个基准把该模型排进各自的前 10 名来排序,并列时看它的最佳名次。每一列保持各自的顺序,此处不做任何平均。

模型 进入前 10 Artificial Analysis LLM Leaderboard IFBench
Grok 4.3 xai 1/1 #1 83.3%
MiniMax-M3 minimax 1/1 #2 82.9%
Nemotron 3 Ultra 550B A55B nvidia 1/1 #3 81.4%
Nemotron Cascade 2 30B A3B nvidia 1/1 #4 80.4%
MiMo-V2.5-Pro xiaomi 1/1 #5 79.9%
Nova 2.0 Pro Preview aws 1/1 #6 79.6%
Qwen3.5 397B A17B alibaba 1/1 #7 78.8%
Qwen3.7 Plus alibaba 1/1 #8 78.0%
Gemini 3.1 Pro Preview google 1/1 #9 77.1%
DeepSeek V4 Pro deepseek 1/1 #10 76.5%

破折号表示该数据源未收录这个模型,而不是它得了零分。模型名录中没有条目的模型不在此处出现,因为它们无法跨数据源对齐——它们仍会显示在各自数据源的看板上,并带有标记。