看大模型的「价格—得分」散点图,人人都在做同一件事:眯着眼找左上角那几个点,其余的假装没看见。斩杀线把这一眼替你看了,每次用同一把尺子,答案直接画在图上。
斩杀者
先立一条规则:如果模型 A 至少一样便宜,又至少一样强——同样的价钱分更高,或者同样的分数更便宜——就说 A 斩杀了 B。把榜上每个模型斩杀的数量数一遍,斩得最多的那个就是斩杀者。平手时取更便宜的,再平取更强的。
斩杀者不是最强的模型,也不是最便宜的。它标出的是一个价位:过了这个价,多花的钱在这张榜上不再换来更高的分。多数时候,它是一个看图之前很少有人会点名的模型。
一个十字,三个区域
在斩杀者的价格处画一条竖线,在它的得分处画一条横线,这个十字就是斩杀线。榜上每个模型都恰好落进三块之一:
- SOTA,横线以上:得分高过斩杀者。它可能贵得多,斩杀线不因此扣它的分。过了斩杀者这个价位,多花的钱唯一还能买到的,就是更高的分数。
- 低成本,左下方:更便宜,也更弱。这是取舍,不是失误,预算说了算的时候就选它。
- 被斩杀,右下方:价格不低于斩杀者,得分却不比它高。选它,就是多花钱买斩杀者已经给得起的东西。
剩下那个角注定是空的。一个比斩杀者更便宜又更强的模型,能斩杀斩杀者斩杀的全部,外加斩杀者本身,那它才该是斩杀者。
首页画的是综合榜的斩杀线。编程和智能体两个场景各画各的,用的是该场景最倚重的那项基准,所以写代码最划算的模型,不一定是综合最划算的那个。
这条线不做的事
**两个轴来自同一个数据源。**价格和得分由同一家机构发布、用同一种方式测量。把一个榜的价格和另一个榜的分数拼在一起,画出来的点没有人真正测过;所以不公布价格的榜只排名次,不画斩杀线。
**每次刷新都重算。**斩杀者易主,可能因为新模型发布,也可能只因为一次调价:某个模型每百万 token 的价格翻了四倍,十字就会挪动,换另一个模型接手。我们不为了让线看起来稳定而做平滑;每张榜都写明数据来源和抓取时间,任何一次变动都能追溯。
**下线的模型不参与画线。**数据源已不再列为当前的模型,会被放到十字上定位,但不能当斩杀者,不计入斩杀数,也不计入任何一档的统计。一个已经买不到的斩杀者,不能让任何模型变得不值得买。
它没告诉你的
斩杀线只看价格和一项测出来的能力,别的一概不管。被斩杀的模型照样可能是你的正确选择:开源权重可以自己部署,上下文窗口更长,许可协议法务能接受,延迟达标。它说的只是:按这个数据源的测量,就这一项能力而言,你多付的钱买的不是分数。
图上那条浅色折线连起的,是价格和得分都没被同时超过的模型,叫前沿。它回答的是另一个问题:「我这点预算,最好能买到什么」。它在点与点之间连线,所以从斜线上读出来的分数落在两个模型之间,并不对应一个真能买到的模型。
接着看
- 家族榜和厂商榜:同一张榜,按产品线或公司折叠,各由最强的一款出战。
- Harness 榜:Claude Code、Codex 等编程智能体工具,按每任务花费画出它们自己的斩杀线。
- 术语表解释其余的词,OnlySOTA 如何读一份榜单讲每个数字从哪里来。